في خطوة جديدة نحو إدارة الأعمال بشكل أكثر فعالية، تقدّم مرقب (Mercor) بالشراكة مع Ramp مؤشراً مبتكراً يحمل اسم APEX-Accounting. هذا الاختبار مصمم لتقييم مدى قدرة نماذج الذكاء الاصطناعي الحديثة على القيام بمسؤوليات المحاسبين بشكل فعّال.
تتضمن المهام المُوكلة في هذا المؤشر أعمالاً محورية كالتسوية بين الحسابات، وتسجيل النفقات، ونشر المعاملات، وإعداد التقارير. يتألف الاختبار من 160 مهمة مقسمة عبر 10 عوالم، حيث يحتوي كل عالم على نظام محاسبي، بالإضافة إلى جداول بيانات (Spreadsheets)، وملفات PDF، وغيرها من الوثائق.
وقد تم تصميم كل مهمة وحلها بواسطة خبراء في المحاسبة والمحاسبة العامة، الذين وضعوا أيضاً معايير التقييم. تمثل الأرقام المقدمة أداء تسعة نماذج متقدمة حيث تصدّر نموذج Claude-Fable-5 (Max) القائمة محققاً 56.4% في معيار Mean Criteria@3، متقدماً على نموذج Muse-Spark-1.1 (xHigh) الذي سجل 52.6%.
ومع ذلك، لم تحقق أي من النماذج معدلات تجاوز تزيد عن 2.6% في معيار Pass^8، فيما استحوذ نموذج Muse-Spark-1.1 (xHigh) على أعلى معدل تجاوز عند 21.5%. توضح التجارب أن الأداء يتحسن مع زيادة ميزانية التوكنات (Tokens)، ولكن الظاهرة المثيرة للاهتمام هي فشل النماذج في تحقيق أداء أعلى على المهام التي تتطلب إنفاق المزيد من التوكنات.
جدير بالذكر أن APEX-Accounting كاختبار مغلق يُمكن أن يُستخدم لإجراء تقييمات لمختلف النماذج عند الطلب. هذه المبادرة ليست مجرد خطوة نحو الابتكار، بل تمثل رؤية جديدة لكيفية استخدام الذكاء الاصطناعي في الأعمال المحاسبية.
ما رأيكم في هذه التجربة الجديدة؟ هل تعتقدون أن الذكاء الاصطناعي سيكون له دور أكبر في المستقبل؟ شاركونا آراءكم في التعليقات!
APEX-Accounting: اختبار مُبتكر لتقييم أداء نماذج الذكاء الاصطناعي في أعمال المحاسبة!
تم إطلاق APEX-Accounting كمؤشر حديث لتقييم أداء نماذج الذكاء الاصطناعي في مهام المحاسبة. يتضمن الاختبار 160 مهمة متخصصة، وراءها فريق من الخبراء في المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
