في عالم الذكاء الاصطناعي المتطور، أصبحت نماذج اللغات الضخمة (Large Language Models) المستخدمة كقضاة تمثل نقطة محورية في تقييم الاستجابات للمهام المفتوحة، حيث غالبًا ما تفتقر هذه المهام إلى إجابات حقيقية. تتناول دراسة جديدة تأثير جودة الأحكام وتصميم البروتوكولات المستخدمة في هذه النماذج على فائدتها النهائية.
فالاتجاه السائد كان يتجه نحو استخدام الأحكام الناتجة لتحفيز نماذج الذكاء الاصطناعي دون النظر إلى جودة هذه الأحكام وكيفية استغلالها بشكل أفضل. الدراسة تقوم بتسليط الضوء على كيفية جمع هذه الأحكام وطرق استخدامها، قائلة إنه يجب علينا الاهتمام بتصميم بروتوكولات القضاة من خلال ثلاثة جوانب رئيسية: دقة الأحكام، طريقة تقديم الانتقادات، وتجميع التقييمات.
كما تم توسيع استخدام القضاة ليشمل فترة الاختبار، حيث تم اقتراح استراتيجيات جديدة مثل اختيار أفضل النتائج (Best-of-N selection) والتعديل المدعوم بواسطة القاضي (Judge-guided revision) وغيرها.
والأهم من هذا، تؤكد النتائج أن الجودة الحقيقية للأحكام ليست دائمًا متطابقة مع الفائدة العملية المكتسبة منها. فقد أظهرت الدراسة أن تصميم البروتوكولات له تأثير كبير على الجودة والفائدة، مما يستدعي إعادة التفكير في الطريقة التي يتم بها تقييم نماذج اللغة في المهام المفتوحة بحيث تشمل تقييمًا متكاملًا للجودة الداخلية والأداء النهائي.
إعادة تصور الذكاء الاصطناعي كقاضي: من جودة الأحكام إلى الفائدة المطلوبة!
تظهر دراسة جديدة تأثير تصميم بروتوكولات القضاة (Judges) في جودة الأحكام المستخدمة في تقييم المهام المفتوحة. النتائج تكشف عن أهمية إعادة تقييم كيفية استخدام هذه الأحكام لزيادة فائدتها العملية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
