في عالم الذكاء الاصطناعي، أصبحت موضوعات التعلم المعزز والمكافآت القابلة للتحقق في الآونة الأخيرة محط اهتمام كبير. حيث تواجه تقنيات التعلم المعزز مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) تحدي التغذية الراجعة النادرة على مستوى المهام، بينما يقدم التقطير القائم على السياسة (On-policy Distillation - OPD) توجيهاً كثيفاً على مستوى الرموز، لكنه يتجاهل صحة المسارات، مما يحد من أدائه ليكون مماثلاً لأداء المُعَلِّم.

ومع ذلك، نجد في دمج هذين الاتجاهين أملاً واعدًا. حيث يوفر OPD إشارات إشراف كثيفة، بينما يمنح RLVR صحة على مستوى المهام. لكن الت integrations الحالية غالباً ما تعتمد على الجمع بالوزن أو التبديل الهيوريستيكي، مما يؤدي إلى تضمين معلمات إضافية وتجارة.

في هذا السياق، نقترح طريقة جديدة تُدعى "التقطير القائم على السياسة مع مكافأة قابلة للتحقق" (On-policy Distillation with Verifiable Reward - OPDVR)، التي تُعتبر حلاً فعالًا يجمع بين OPD وRLVR دون الحاجة لإضافة أي معلمات. أولاً، نقوم بإعادة صياغة المكافأة الضمنية الخاصة بالتقطير عينة الرموز OPD استنادًا إلى صحة المسارات، ثم نطبق آلية ReLU للتحكم للتأكد من أن المسارات الصحيحة تتلقى مكافآت غير سالبة وأن المسارات غير الصحيحة تتلقى مكافآت سالبة. هذا يضمن توافق إشارة التقطير مع نجاح المهمة مع الحفاظ على توجيه الانقسام للنموذج المعلم.

علاوة على ذلك، تجعل تعديلاتنا من OPD عينة الرموز منه وسيلة صحيحة لـ RLVR، مما يجعلها قابلة للجمع بسهولة مع أي خوارزمية تدرج سياسة، مثل GRPO. أظهرت التجارب على ستة معايير عقلانية أن OPDVR تفوقت باستمرار على OPD القياسي. يمكنك الاطلاع على شيفرتنا البرمجية المتاحة هنا.

ما رأيكم في هذه التطورات المذهلة في مجال الذكاء الاصطناعي؟ شاركونا رأيكم في التعليقات.