في عالم الذكاء الاصطناعي المتطور، أصبحت نماذج اللغات الضخمة (Large Language Models) المستخدمة كقضاة تمثل نقطة محورية في تقييم الاستجابات للمهام المفتوحة، حيث غالبًا ما تفتقر هذه المهام إلى إجابات حقيقية. تتناول دراسة جديدة تأثير جودة الأحكام وتصميم البروتوكولات المستخدمة في هذه النماذج على فائدتها النهائية.

فالاتجاه السائد كان يتجه نحو استخدام الأحكام الناتجة لتحفيز نماذج الذكاء الاصطناعي دون النظر إلى جودة هذه الأحكام وكيفية استغلالها بشكل أفضل. الدراسة تقوم بتسليط الضوء على كيفية جمع هذه الأحكام وطرق استخدامها، قائلة إنه يجب علينا الاهتمام بتصميم بروتوكولات القضاة من خلال ثلاثة جوانب رئيسية: دقة الأحكام، طريقة تقديم الانتقادات، وتجميع التقييمات.

كما تم توسيع استخدام القضاة ليشمل فترة الاختبار، حيث تم اقتراح استراتيجيات جديدة مثل اختيار أفضل النتائج (Best-of-N selection) والتعديل المدعوم بواسطة القاضي (Judge-guided revision) وغيرها.

والأهم من هذا، تؤكد النتائج أن الجودة الحقيقية للأحكام ليست دائمًا متطابقة مع الفائدة العملية المكتسبة منها. فقد أظهرت الدراسة أن تصميم البروتوكولات له تأثير كبير على الجودة والفائدة، مما يستدعي إعادة التفكير في الطريقة التي يتم بها تقييم نماذج اللغة في المهام المفتوحة بحيث تشمل تقييمًا متكاملًا للجودة الداخلية والأداء النهائي.