في عصر التكنولوجيا الحديثة، تعتبر نماذج اللغة (Language Models) أدوات حيوية لفهم الأداء اللغوي. غالباً ما تعتمد هذه النماذج على تقدير دقيق يعتمد على مستوى واحد من الدقة، وهو ما لا يعكس كيف تتدهور أدائها عند مواجهة مدخلات متغيرة. ولتجاوز هذا التحدي، قدم الباحثون إطاراً مبتكراً يهدف إلى قياس أداء نماذج اللغة تحت مجموعة من الظروف المتغيرة.

تم تصميم هذا الإطار ليكون متدرجاً، ويؤخذ بعين الاعتبار العوامل متعددة المستويات التي قد تؤثر على أداء النموذج. تشمل هذه العوامل ست فئات، منها: الحفاظ على الإجابة، إعادة صياغة الجمل، تشويش المدخلات، تخطيط السياق، والسياق غير المتعلق. فضلاً عن وجود عائلة حدود المعرفة التي تهدف إلى إزالة القدرة على الإجابة، مما يجعل الرفض هو الاستجابة الصحيحة.

تمت تجربة الإطار باستخدام 100 مشكلة تم اختيارها، وتم توسيعها لتشمل 4473 اختباراً تم تصنيفها بشكل دقيق من حيث شدتها. تم اختبار أربعة نماذج تغطي مستويات مختلفة من القدرات. وكشفت النتائج عن هيكلية مختلفة تماماً عما تخفيه التقييمات العامة؛ فمستوى الفشل لنموذج ما يختلف بناءً على العائلة التي ينتمي إليها، حيث أظهرت الضغوط المتعارضة والأسئلة المبنية على مقدمات مستحيلة نقاط ضعف ثابتة عبر النماذج المختلفة.

تظهر هذه النتائج أهمية فهم كيفية أداء نماذج اللغة في ظروف غير مثالية، مما يساهم في تحسين دقة التقييمات وتفادي التقييمات الخاطئة في المستقبل. التقدم في هذا البحث قد يعيد تشكيل السبل التي يتم من خلالها قياس كفاءة نماذج الذكاء الاصطناعي، وكيف يمكن للمطورين تحسينها لتلبية احتياجات المستخدمين بشكل أفضل.