تشهد نماذج اللغات الضخمة (Large Language Models - LLMs) تواجدًا متزايدًا في مجال التقييم، حيث تُستخدم كمقياس للنتائج، وأيضًا كحكام ومنقّحين للمحتوى البشري. تعتبر هذه الأدوار المختلفة تحديًا في كيفية فهم ما يتم قياسه بفاعلية.

تحمل نظرية قياس راش (Rasch Measurement Theory - RMT) الإجابة لهذا التحدي، حيث تقوم بتفكيك التقييمات العرفية إلى جوانب قابلة للفهم على مدى مشترك. بالإضافة إلى ذلك، توفر RMT مجموعة من التقنيات التشخيصية التي تكشف عن قياسات غير مضبوطة والتحيزات لدى المقيمين.

وقد تم إجراء دراسة حالة لتطبيق RMT في نموذج LLM كجهة تقييم، باستخدام مجموعة بيانات Measuring Hate Speech، والتي تم بناؤها وفقًا لمبادئ RMT. من خلال هذا التطبيق، تم إبراز اختلافات كبيرة بين تقييمات LLMs والمقيمين البشريين في شدة التحكيم، وضبط مستوى العناصر، وحساسية هوية الهدف.

هذه النتائج تسلط الضوء على ضرورة دمج RMT في أدوات تقييم نماذج اللغات الضخمة كجهة امتحان أو حكم أو مقيم، لتقديم تقييمات أكثر دقة وموضوعية.