في عالم الذكاء الاصطناعي، يُعتبر تقييم أداء نماذج اللغة الضخمة (Large Language Models) جزءًا أساسيًا من تحسين كفاءة الأعمال. ومع ذلك، كانت التقييمات السابقة تفتقر إلى معايير واضحة تتعلق بتسليم منتجات قابلة للتحقق داخل بيئات عمل مضبوطة. لهذا السبب، تم تقديم SQBench، وهو معيار تقييم جديد يركز على كيفية تسليم وكلاء نماذج اللغة المهام في سياقات العمل الإنتاجية.

تجلب النسخة الأولى من SQBench 220 مهمة موحدة، مقسمة إلى ثلاثة مستويات: القدرات الأساسية (L1)، المهارات المركبة (L2)، وسيناريوهات الأعمال (L3). تعتمد كل مهمة على قدرة الوكيل على معالجة المدخلات، واستخدام الأدوات المتاحة، وإنتاج منتج محدد بوضوح.

تسعى SQBench أيضًا إلى قياس الجانب الوظيفي للتسليم من خلال حساب نسبة الإنجاز (Completion) والسماح بظهور معايير للمخاطر التي تتمثل في مصفوفة المخاطر العشرة الأبعاد (10D Risk Matrix). يمكن أن يُطلق لقب النجاح الصارم فقط على المهام التي تحقق إنجازًا كاملاً دون أي مخاطر.

في نتائج التجربة، تم اختبار 27 إعدادًا مختلفًا من النماذج، وتبين أن الأداء في المستوى الثالث (L3) كان أقل بشكل عام مما كان عليه في المستويين الأول والثاني، مما يكشف عن ضعف مشترك في تسليم المهام ضمن قيود محددة.

على الرغم من الإنجازات الوظيفية، وجد أن 4.8% من النتائج الحاصلة على نسبة إنجاز واحدة لم تحقق معيار النجاح الصارم بسبب مخاطر مثل اقتباسات غير قابلة للتحقق، أو استخدام غير مناسب للموارد، أو انتهاكات في التنسيق. تُظهر هذه النتائج ضرورة دراسة الجودة بشكل منفصل عن الإنجاز الوظيفي، مما يعزز من أهمية معيار SQBench في تحسين الأداء العام لوكلاء نماذج اللغة في المستقبل.

ما رأيكم في هذه التطورات المثيرة؟ شاركونا في التعليقات!