في عالم الذكاء الاصطناعي، تظل نماذج اللغة أدوات حيوية تتطلب دقة متناهية في تقييم أدائها. ومع ذلك، فإن الكثير من المهام المتعلقة بها لا يمكن تقييم نتائجها بدقة من خلال التحقق التام من النتائج. لحل هذه المشكلة، تم تطوير نموذج التعلم المعزز القائم على التقييم (Rubric-based Reinforcement Learning) الذي يسعى لمنح الدرجات للاستجابات المفتوحة بناءً على معايير واضحة.

لكن، تبقى التحديات قائمة، خاصةً أن مكافأة الأداء تُعطى بعد الحصول على الاستجابة الكاملة، مما يجعل من الصعب رصد القرارات الفردية التي ساهمت في الحصول على النتيجة النهائية.

لذا، نقدم لكم إطار عمل تدريبي ثنائي المراحل، حيث تُستخدم نظم التقييم أولاً كمصدر متميز لتوجيه الإشراف على مستوى الرموز (Dense Token-Level Supervision)، ثم كجوائز لتحسين التعلم المعزز.

في المرحلة الأولى، تعتمد طريقة التدريج المدعومة بالتقييم (Rubric-Privileged On-Policy Distillation) على مقياس يجعل الطالب، الذي لا يمتلك الوصول إلى التقييم، يتوافق مع توزيعات الجمل التالية لمعلم مدرك لنظام التقييم عند توليد استجابات.

انتقلنا إلى المرحلة الثانية حيث يتم تحسين التعلم المعزز بشكل مباشر بناءً على التعزيزات من نظام التقييم، مما يؤدي إلى تحسين الأداء. أجرينا تقييمًا لهذا الإطار في مهام الصحة والعلوم باستخدام نماذج مفتوحة الوزن، حيث تم استخدام عبارات HealthBench، ResearchQA، وRubricHub Science للنظر في مجموعة متنوعة من أساليب ما بعد التدريب.

النتائج كانت مثيرة للإعجاب، حيث أظهر إطار العمل الثنائي المراحل أعلى النقاط مقارنةً بأساليب التدريب الأخرى. وهي خطوة تدعم استخدام نظم التقييم لتوجيه العمليتين: التعلم القائم على السياسات والتعلم المعزز.

ما رأيكم في هذا التطور؟ هل تعتقدون أن نظم التقييم سوف تُحدث فارقًا في مجالات أخرى أيضًا؟ شاركونا في التعليقات.