في عالم الذكاء الاصطناعي، ظهر مفهوم "نموذج اللغة الكبير كقاضٍ" (LLM-as-a-Judge) كأحد الأنماط الواعدة لتقييم توليد اللغة الطبيعية. ولكن، لا تزال تحديات الافتقار إلى اليقين بشأن هذه التقييمات مشكلة لم تُستكشف بشكل كافٍ، مما يحد من موثوقيتها في التطبيقات الواقعية. لذا، اقترح فريق من الباحثين إطار عمل قوي لتقييم عدم اليقين في هذه النماذج.

يقدم هذا البحث أسلوباً متطوراً يعتمد على "التنبؤ المتسق" (Conformal Prediction) كإطار عمل لتقدير عدم اليقين في تقييم النماذج. من الأمور الشائعة في الأساليب الحالية أنها تطبق هذه التقنية على نموذج قاضي واحد، وهي نظرة لا تأخذ بعين الاعتبار التباين الذي يمكن أن ينجم عن استخدام قضاة مختلفين من نماذج اللغات الكبرى.

وتمكن الإطار الجديد من إنشاء فترات تقييم تم التنبؤ بها من خلال إشراك نماذج LLM متعددة، مما يعزز من استقرار وموثوقية التقديرات. وقد أظهرت التجارب المكثفة أن هذه الطريقة تُنتج فترات تنبؤ صحيحة مع ضمانات تغطية، وأن التقييم القائم على الفترات عبر قضاة متعددين يؤدي إلى نتائج تقييم أكثر استقراراً.

هذا البحث يمثل خطوة مهمة نحو تعزيز موثوقية تطبيقات الذكاء الاصطناعي في مجالات متعددة، ويفتح آفاقاً جديدة للبحث في كيفية تحسين عملية تقييم الذكاء الاصطناعي.