تتسابق شركات التقنية اليوم لتطوير نماذج اللغات الضخمة (Large Language Models) بطرق تزيد من فعاليتها وكفاءتها، لكن في خضم هذا التسابق، تظهر تحديات كبيرة في آليات تقييم هذه النماذج. "تقييم النتائج فقط" هو النهج التقليدي المتبع، حيث يُعرض على الحكام الطلب والرد النهائي، ويتم الحكم على ما إذا كان قد تم التعامل مع الطلب بشكل جيد.

ومع ذلك، هذا النهج قاصر، لأنه يغفل الطرق التي تم من خلالها الوصول إلى الإجابة الصحيحة. في دراسة حديثة، تمت دعوة عدد من الحكام لتقييم خمسة نماذج مختلفة بناءً على قدرتها على تحديد الأخطاء وتصنيفها، إضافةً إلى مدى نجاحها في تحقيق النتائج المطلوبة.

استخدم الباحثون بيئة دعم معينة حيث يتم إدخال الأخطاء بشكل مدروس، وتبين أن القاضي الذي يعتمد تقييم النتائج فقط ينجح في اكتشاف 84% من الأخطاء الواضحة، لكنه في المقابل، لا يمكنه كشف 45% من الأخطاء الصامتة، بينما تحققت معدلات نجاح تتجاوز 77% من الأخطاء الصامتة عند استخدام نموذج يحتوي على تقييم دقيق.

الأدهى من ذلك، هو أن القضاة لم يقيموا الردود النهائية جيدًا، حيث تم خداعهم من خلال وعد مزيف تم إضافته لمقاطع مثالية. وفي النهاية، تُظهر هذه التجارب الحاجة إلى أن تشمل تقييمات القضاة أيضًا كيفية بقاء النتيجة المرئية النهائية، مما يستوجب تطوير بيئات فعلية تتضمن جهات للتقييم وأدوات تحليلية مبسطة.

في ظل هذه الأبحاث والابتكارات، يبقى السؤال: كيف يمكننا تحسين طرق تقييم نماذج اللغات الضخمة بما يضمن عدم تجاهل الجوانب الحاسمة في عملية الحكم؟