في عالم الذكاء الاصطناعي، يظهر تعلم التعزيز (Reinforcement Learning) كأداة فعّالة لتحسين القدرات العقلانية لنماذج اللغة الضخمة (Large Language Models). لكن، كما هو الحال مع العديد من الأساليب الحديثة، كانت هناك بعض التحديات المتعلقة بدقة التغذية الراجعة على إجابات النموذج وظهور تباين في صعوبة الأسئلة.

لذا، أُقدمت علينا التقنية الجديدة CVPO – والتي تعني تحسين السياسة المستندة إلى القيمة والتباين الموجه بالمنهاج الدراسي. من خلال هذا البحث، تم التعرف على أن تباين القيم على مستوى الرموز يرتبط بشدة استكشاف النموذج. تحليلنا النظري يظهر أن هذا التباين يحدد حجم تحديث السياسة.

تم تصميم آلية تعديل متقدمة تعي التباين لتعزيز قدرة النموذج، مما يؤدي إلى تحسين كبير في أدائه. تتضمن هذه التقنية أيضًا أسلوب وزن المنهاج الديناميكي والذي يتكيف مع صعوبة الأسئلة، مما يساعد النموذج على التركيز على المهام المتوافقة مع قدراته الحالية خلال مختلف مراحل التدريب.

تشير النتائج التجريبية إلى أن CVPO تتفوق على الأساليب التقليدية مثل VAPO، حيث تحقق تحسنًا ملحوظًا في القدرات الاستدلالية للنماذج اللغوية عند معالجة مجموعة متنوعة من مسائل الرياضيات المعقدة.