تعد النماذج اللغوية الكبيرة (Large Language Models - LLMs) واحدة من أشهر الابتكارات في مجال الذكاء الاصطناعي، حيث أصبحت لديها القدرة على فهم وإنتاج النصوص بطريقة مشابهة للبشر. ومع ذلك، يبقى تحدي تقييم أدائها على الأسئلة غير المعروفة أمرًا محوريًا، خاصةً مع تنوع صعوبة الأسئلة والسياقات التي تُطرح فيها.

في دراسة جديدة نشرت على arXiv، تم اقتراح إطار عمل تقييم يعتمد على نموذج نظرية الاستجابة العنصرية متعددة الأبعاد (Multidimensional Item Response Theory - IRT) لتوقع أداء النماذج على أسئلة جديدة. يركز هذا الإطار على تمثيل قدرات النماذج من خلال ملفات قدرات الكامنة، باستخدام محتوى الأسئلة لتوجيه خصائص العناصر. هذا يسمح بنقل المعلومات إلى ما يتجاوز العناصر التي تم ملاحظتها سابقًا.

تُظهر نتائج البحث أن دمج تمثيلات الأسئلة (Question Embeddings) يعزز من دقة التوقعات مقارنةً بالأساليب التقليدية غير المعتمدة على نماذج معينة. بالإضافة إلى ذلك، يوفر هيكل القدرة متعددة الأبعاد وصفًا أغنى لتنوع القدرات مقارنةً بالخيارات أحادية الأبعاد.

ومع ذلك، تكشف النتائج أيضًا عن قيود مهمة: فالتعميم عبر السيناريوهات المختلفة لا يترجم بالضرورة إلى توقعات موثوقة في التحولات بين السيناريوهات. تشير هذه النتائج إلى أن النمذجة النفسية الواعية بالسياق هي اتجاه واعد في تقييم النماذج اللغوية الكبيرة، لكنها تؤكد أيضًا على أن التعميم عبر السيناريوهات هو تحدٍ مفتوح رئيسي يتطلب مزيدًا من البحث.