تشير الأبحاث الجديدة إلى أن أنظمة نماذج اللغات الكبيرة كقضاة (LLM-as-Judge) ليست مجرد أدوات لتقييم المعلومات، بل تلعب دورًا حاسمًا في إنتاج تقييمات متعددة الأبعاد تشمل الثقة والموثوقية والحقائق. تم اختبار الفرضية القائلة بأن تقييمات الثقة يمكن اعتبارها أدلة مستقلة عن الأحكام الحقيقية.

قام الباحثون بتحليل زوج شائع من الأحكام: تقييم الثقة وتصنيف الحقيقة الثنائي، مؤكدين أن نماذج اللغات الكبيرة توازن بين النتائج بشكل أكثر دقة من القياسات الإنسانية. كما أظهرت النتائج أن فرضيات اعتماد ثقة الأداة كدليل مستقل عن الحقيقة لم تعد صحيحة.

عبر إجراء اختبارات ضغط بتغيير مؤشرات المصدر فقط بين البشر والذكاء الاصطناعي، تبين أن تحويل مصادر المعلومة يؤثر ليس فقط على درجات الثقة، بل وعلى الأحكام الحقيقية أيضًا. هذه المكتشفات تشير إلى ضرورة إعادة النظر في البروتوكولات الحالية المتبعة في أنظمة (LLM-as-Judge)، حيث لا ينبغي اعتبار درجات الثقة كأدلة مستقلة عن الأحكام الحقيقية.