في عالم الذكاء الاصطناعي، يُعتبر تقييم أداء نماذج اللغة الضخمة (Large Language Models) جزءًا أساسيًا من تحسين كفاءة الأعمال. ومع ذلك، كانت التقييمات السابقة تفتقر إلى معايير واضحة تتعلق بتسليم منتجات قابلة للتحقق داخل بيئات عمل مضبوطة. لهذا السبب، تم تقديم SQBench، وهو معيار تقييم جديد يركز على كيفية تسليم وكلاء نماذج اللغة المهام في سياقات العمل الإنتاجية.
تجلب النسخة الأولى من SQBench 220 مهمة موحدة، مقسمة إلى ثلاثة مستويات: القدرات الأساسية (L1)، المهارات المركبة (L2)، وسيناريوهات الأعمال (L3). تعتمد كل مهمة على قدرة الوكيل على معالجة المدخلات، واستخدام الأدوات المتاحة، وإنتاج منتج محدد بوضوح.
تسعى SQBench أيضًا إلى قياس الجانب الوظيفي للتسليم من خلال حساب نسبة الإنجاز (Completion) والسماح بظهور معايير للمخاطر التي تتمثل في مصفوفة المخاطر العشرة الأبعاد (10D Risk Matrix). يمكن أن يُطلق لقب النجاح الصارم فقط على المهام التي تحقق إنجازًا كاملاً دون أي مخاطر.
في نتائج التجربة، تم اختبار 27 إعدادًا مختلفًا من النماذج، وتبين أن الأداء في المستوى الثالث (L3) كان أقل بشكل عام مما كان عليه في المستويين الأول والثاني، مما يكشف عن ضعف مشترك في تسليم المهام ضمن قيود محددة.
على الرغم من الإنجازات الوظيفية، وجد أن 4.8% من النتائج الحاصلة على نسبة إنجاز واحدة لم تحقق معيار النجاح الصارم بسبب مخاطر مثل اقتباسات غير قابلة للتحقق، أو استخدام غير مناسب للموارد، أو انتهاكات في التنسيق. تُظهر هذه النتائج ضرورة دراسة الجودة بشكل منفصل عن الإنجاز الوظيفي، مما يعزز من أهمية معيار SQBench في تحسين الأداء العام لوكلاء نماذج اللغة في المستقبل.
ما رأيكم في هذه التطورات المثيرة؟ شاركونا في التعليقات!
SQBench: معيار جديد لتقييم أداء وكلاء نماذج اللغة في بيئات العمل الإنتاجية!
تم إطلاق SQBench، معيار تقييم مبتكر يهدف إلى تحسين أداء وكلاء نماذج اللغة في تسليم المهام ضمن بيئة عمل محددة. يتضمن المعايير الجديدة التقييم الوظيفي والمخاطر المرتبطة بالتسليم لضمان جودة أعلى.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
