في عالم الذكاء الاصطناعي، يمثل تدريب الناقد أحد التحديات الأساسية، خاصة عند التعامل مع نماذج اللغات الكبيرة (Large Language Models). وفي أحدث الدراسات، تم تقديم طريقة مبتكرة تعرف بـ "تحسين الناقد بأسلوب أفضل (Best-Practice Critic Optimization - BPCO)" التي تعد بتوفير شكل أكثر استقراراً وفعالية لتدريب الناقد.

تتجنب الطرق التقليدية مثل أساليب التعلم المعزز القائم على المجموعة (Group-Based Reinforcement Learning Methods) تكوين ناقد مركزي من خلال أخذ عينات من ردود متعددة لكل استفسار. بدلاً من ذلك، يمكن أن يقوم ناقد موثوق بتقدير مزايا على مستوى الرموز من استجابة واحدة فقط.

ومع ذلك، فإن الوصفات التدريبية التقليدية الخاصة بالناقد غالبًا ما تكون غير مستقرة. لذلك، قامت هذه الدراسة بدراسة عدم الاستقرار وتطوير مجموعة من الاستراتيجيات التي تجمع بين أساليب مختلفة منها DPPO، وتقييد التوقعات للقيمة ضمن نطاق المكافآت، بالإضافة إلى استراتيجيات التقريب اللاموزون.

تم إجراء تجارب مضبوطة لعزل تأثير كل خيار تصميمي، وأثبتت النتائج التي تم الحصول عليها من مجموعة واسعة من نماذج اللغات الكبيرة، من 1.5 مليار إلى 30 مليار مع مزيج من الخبراء، أن BPCO تحسن بشكل ثابت من أداء الناقد القائم.

الأكثر إثارة هو ما تضمنته الدراسة من إمكانية استخدام الناقد لتكييف استجاباته مع معلومات تعريف المكافآت، مثل الإجابات المرجعية أو معايير التقييم، والتي تكون مخفية عن السياسة، مما يزيد من احترافية النتائج الناتجة.

تظهر هذه النتائج أن الناقد المصمم بعناية يوفر بديلاً موثوقًا لتقدير المزايا النسبية الجماعية، ويعزز التعلم المبني على المكافآت القائمة على المعايير. ويمكن للمهتمين الاستفادة من الكود المتاح على منصة GitHub لإنشاء تطبيقاتهم الخاصة.