في عالم الذكاء الاصطناعي، يُعد الأمان من الأولويات القصوى، حيث تتفاوت سلوكيات نماذج اللغة (Language Models) من حيث الأمان. ولقياس هذه الفروقات، تم تطوير مجموعة من المعايير، لكن الاعتماد على نتائجها كان يواجه بعض التحديات، منها تكرار المعايير والتداخل بينها.

للتغلب على هذه المشكلات، تم الاعتماد على نظرية استجابة العنصر (Item Response Theory - IRT)، وهي أداة إحصائية طُورت لقياس الخصائص النفسية غير المرئية من خلال أداء النماذج في اختبار تم تصميمه بعناية. تم تطبيق نماذج IRT على ثمانية معايير أمان عبر 192 نموذجاً للغة، مما يعد أكبر تحليل نفسي لتقييم أمان نماذج الذكاء الاصطناعي حتى الآن.

من خلال هذه الدراسة، توصل الباحثون إلى ثلاث نتائج رئيسية: أولاً، وجدوا أن هناك ثلاثة عوامل قابلة للتفسير، تشمل صرامة الرفض (Refusal Strictness) والصدق (Truthfulness) والأذى السياقي (Contextual Harm)، تُفسر معظم الفروقات بين النماذج عبر المعايير. ثانياً، تُمكن عناصر مختارة نفسياً من استعادة درجات المعايير بالكامل بأخطاء أقل مقارنةً بالمجموعات العشوائية من نفس الحجم، حيث أن حوالي عشرة عناصر يتم اختيارها بشكل تكيفي كافية للعديد من المعايير الفردية، مما يُخفض تكلفة التقييم بنسبة تتراوح بين 97% إلى 99%. ثالثاً، تدعم IRT عمليات تدقيق النماذج الفردية، حيث تُظهر أنها يمكن استخدامها لاكتشاف محاولة التلاعب من قبل النماذج التي تتعرف على التقييمات.

في المجمل، تُظهر هذه النتائج أن IRT هي أداة جاهزة لقراءة وتبسيط ودعم معايير الأمان. لذا، يُوصى للمختبرات المتقدمة والمقيمين بتبنيها لتحسين تقييمات أمان النماذج.