في عالم الذكاء الاصطناعي المتطور، تتجه الأنظار نحو نموذج اللغة الكبير (Large Language Model - LLM) الذي يقدم رؤى متقدمة في كيفية تقييم الأداء. تشير الأبحاث الجديدة إلى أن استخدام نماذج الحكم الحالية غالبًا ما يتم تقليصه إلى نتائج ثنائية (نجاح/فشل) دون تزويدنا برؤية عميقة حول كيفية تلبية استجابة معينة لمعايير بعينها.

تقدم الدراسة نموذجًا يقوم على توفير نظام تقييم أكثر تعقيدًا، حيث يتم احتساب كل نتيجة كدرجة على مقياس غير مُبلّغ، مما يتيح حركة أكثر دقة حول معايير التقييم. وهذا يعني أنه يمكن تطبيق تمديدات مختلفة دون أي تغيير في النتائج.

من خلال اعتماد نموذج حوادث مشترك، تم إدخال عتبة ثانية تنزع الغموض الناجم عن التمديد الخطي. وتظهر النتائج من تجارب على نماذج MATH وSciBench أن جميع المدخلات التي تم توسيع معاييرها كانت غير مرئية بعد مرحلة التثنية ولكنها أصبحت واضحة عند استخدام ثلاث درجات. وقد أظهرت التجارب قدرة تجاوز 96.5% عند مستويات ضغط معينة.

لذا، توصي الدراسة بجعل النظام يستخدم على الأقل ثلاث درجات (كأن يسأل القاضي عما إذا كان كل معيار تم تلبيته بشكل كامل، جزئي، أو غير مُلبّى)، مع توثيق أي تقدم ممكّن لتجنب حالة التحيز في الحكم والتي قد تُفسر على أنها كفاءة. هذه الرؤية الجديدة لتقييم الأداء قد تُحدث تحولًا في كيفية فهمنا لقدرات النماذج ومعاييرها.