في سعيهم نحو تحسين أداء نماذج التعلم المعزز، أطلق الباحثون تقنية جديدة تُعرف باسم Semifactual Credit-Augmented Policy Optimization (SCAPO). هذه التقنية تأتي كاستجابة لتحديات حساسية نماذج اللغة الكبيرة (Large Language Models) للعوامل غير المرتبطة بالمهام.

تُظهر الأبحاث أن التعلم المعزز مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards) قد ساهم فعلياً في تحسين قدرات التفكير لدى نماذج اللغة الكبيرة، لكن المشكلات لا تزال قائمة. من خلال التدخلات النصف فعلية (Semifactual Prompt Interventions)، يقوم الباحثون بدراسة آثار حساسية النماذج لمكونات غير ملائمة خلال عملية توقع النتائج.

تقدم SCAPO طريقة مبتكرة لتقدير اعتماد المكافآت على مستوى الرموز، حيث تقوم بتقليل المزايا الممنوحة للرموز غير المستقرة أثناء التدريب المبكر، دون منح أي قيمة إضافية للاستقرار بمفرده. بدلاً من ذلك، تركز SCAPO على قياس الانجراف في احتمالية الرموز الثابتة، مما يسهم في تحسين الدقة.

وتكشف التحليلات أن SCAPO تحسن دقة النتائج بمعدل ملحوظ – حيث توقعت نتائج تفوق بنسبة 5.63% و4.17% عند مستويات نموذج Qwen3-4B-Base وQwen3-1.7B-Base على التوالي، مقارنة بأساليب Group Relative Policy Optimization التقليدية. من المثير للاهتمام أن SCAPO حققت كذلك أفضل النتائج ضمن الاختبارات الرياضية المعتمدة والمقاييس التي لم يتم رؤيتها ضمن بيانات التعلم.

يُظهر هذا التطور الجديد كيف يمثل الاستقرار النصفّ فعلي إشارة تدريب فعّالة لتحسين التفكير والعمومية في نماذج التعلم المعزز. يمكن للمطورين والباحثين استعراض الشيفرة المصدرية عبر github للحصول على تفاصيل أكثر.