في عالم الذكاء الاصطناعي، أصبح تقييم النماذج المستخدمة كقضاة أمرًا بالغ الأهمية، ولكن كيف نحدد فعلاً مدى دقة وموثوقية هذه النماذج؟ في دراسة حديثة نُشرت على منصة arXiv تحت العنوان "LLM-as-a-judge evaluation"، استعرض الباحثون مفهوم "صلاحية البناء" (Construct Validity)، وهو ما يعني مدى قدرة النموذج على تقديم أحكام قانونية موثوقة.

تقوم هذه الدراسة بتعريف صلاحية البناء كمؤشر ثنائي الأبعاد يتضمن "الثبات" (Invariance) و"الحساسية" (Sensitivity). حيث يقيس الثبات إمكانية بقاء الحكم كما هو عند إجراء تغييرات بسيطة على المدخلات، بينما يقيس الحساسية احتمال تغير الحكم تحت تدخلات بعيدة عن البناء الأصلي.

لقد أظهر الباحثون أن الثبات والحساسية هما مستقلان، مما يعني أنه ليس من الجائز الاعتماد على مقياس أحادي لتقييم فعالية النموذج. استخدموا 7 قضاة عبر 4 مجالات مختلفة، وطبقوا 7 أنواع مختلفة من التدخلات، و5 تحكمات للتقييم، مما ساعدهم في الكشف عن الفروقات بين الحساسية والمجال.

وعند تطابق مستوى الثبات (S) بمقدار 0.90 أو أكثر، أفادت النتائج بمتوسط ثبات للقضاة بمقدار 0.945، ولكن عند قياس الحساسية، كانت القيمة 0.319. حيث أظهرت النتائج أيضًا فروقات ملحوظة بين أنواع التعديلات، حيث جاءت المحصلة نحو التعديلات حسب النطاق أعلى من تلك الخاصة بالقوة.

هذه النتائج تسلط الضوء على أهمية تقييم كل من الثبات والحساسية عند تقييم نماذج الذكاء الاصطناعي، وتُشير إلى ضرورة إجراء تدقيق لمجموعات التقييم، حيث أظهرت الدراسة أن التنبؤات السطحية يمكن أن تعيد إنتاج 55% إلى 67% من التصنيفات المعتمدة في أوضاع مقترحة.

هل تعتقد أن تقييم فعالية نماذج الذكاء الاصطناعي كقضاة يتطلب منهجًا أكثر شمولاً؟ شاركونا آرائكم في التعليقات!