تزداد أهمية قضاة نماذج اللغات الضخمة (Large Language Models) في تقييم مدى توافق مخرجات الذكاء الاصطناعي مع متطلبات العمل، لكن هل تضمن التقييمات توافقاً مع معدلات القبول أو التجميعات المهنية؟ في دراسة جديدة تحت عنوان "Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement"، تم تقديم مفهوم O*NET-BENCH، وهو مجموعة تدقيق مشتقة من استقصاء ضخم شمل 45,796 تقييمًا للعمال.

تم تقييم 33 تكوينًا قاضيًا مسبقًا عبر ست عائلات من النماذج على 4,501 تقييم اختبار، وحقق خمسة وعشرون من هذه التكوينات دقة في تقييمات الربط العالية تتجاوز 0.60. ومع ذلك، فإن أداة أساس التقييم المدربة بالكلمات فقط TF-IDF تقترب من قوة أفضل القضاة. على الرغم من التوافق في الترتيب، فإن القضاة يقدرون أن 3.0% إلى 97.9% من الردود مقبولة، بينما يبلغ الرقم 61.1% للعمال ذوي التخصصات المتطابقة.

يظهر التحليل أن الانتقال من نظام النقاط الفردية إلى بروتوكول قليل اللقطات المجمعة يحسن ترتيب الردود، لكنه يقلل من التوافق مع متوسطات العمال على مستويات المهام والمهن. كما تم اكتشاف أن المعايرة المعتمدة على التحصيصات تنزع غالبًا التحيز المتوسط، لكن النقاط المعايرة تفسر على الأكثر 8.5% من التباين في تقييمات العمال الفردية. أيضًا، أثبتت تقديرات المساعدة في التنبؤ، تحقيق تحسن طفيف في الدقة عند الميزانيات المدروسة.

تظهر هذه النتائج أنه لا يكفي مجرد توافق الترتيب لأغراض القياس المهني. لذا، يجب أن يتم التحقق من القضاة بناءً على معدلات القبول والتجميعات التي ستستخدم لتقدير درجاتهم. إذا كنت مهتمًا بالمزيد من هذا النوع من التحليل، ما رأيكم في أهمية تدقيق قضاة الذكاء الاصطناعي؟ شاركونا في التعليقات!