تصاعدت أهمية التعلم المعزز (Reinforcement Learning) في السنوات الأخيرة، لا سيما مع تزايد الحاجة إلى تطبيقات أقوى وفعالة في مجالات الذكاء الاصطناعي. لكن هل يتطلب توسيع نماذج التعلم المعزز مزيدًا من التدريب؟ وفقًا لدراسة جديدة نشرت على arXiv، هناك إجابة مثيرة لذلك السؤال.

تشير النتائج إلى أن تاريخ تدريب التعلم المعزز المكتمل يمكن أن ينتج سياسات أقوى مقارنة بالنقاط المرجعية التي زارها المثبِّت (Optimizer). وقد أطلق الباحثون على هذا المفهوم اسم 'توسيع فضاء السياسة' (Policy-space scaling)، حيث يمكن توسيع مجموعة السياسات القابلة للنشر دون الحاجة إلى زيادة في التدريب أو موارد حساب الاستدلال.

تم تقديم هذه الفكرة الجديدة من خلال تقنية 'SURGE' (توسيع التعلم المعزز بدون تدرج عبر دمج الفضاءات الذاتية)، والتي تجمع بين نقطتي تحقق (Checkpoints) من نفس دورة التعلم المعزز. يتم استخدام نقطة تحقق بدقة عالية كنقطة مرجعية، بينما يتم استخدام نقطة تحقق منافسة لتوليد استجابات أسرع.

تعمل SURGE من خلال إظهار كلا النقطتين كتغييرات من حالتهما المشتركة، ثم يتم تحلل التحديث من نقطة التحقق المرجعية للاحتفاظ بمكونه المهيمن وإدماج المكون التكميلي من النقطة المنافسة. كما يسمح SURGE بتحديد حجم الكتل بناءً على الأوزان دون الحاجة لاختبار سياسات مرشحة.

تتضمن الأنظمة التي تم تقييمها اثنين من تاريخي التفكير الرياضي بقدرة 1.5 مليار، ونموذج 'OLMo' بقدرة 7 مليارات. أظهرت SURGE تحسنًا في دقة المتوسط المرجعي على كلا نقطتي الإدخال بينما استخدمت عددًا أقل من الرموز ليتم التفكير بها. وقد حققت 54.17% على 'DeepSeek AIME24' مقابل أقصى حد تم قياسه بحدود 50.83%، و83.7% على 'OLMo HumanEval+' مقابل 82.8%.

هذه المكاسب تتجاوز منحنيات التدريب الملاحظة، مما يدل على أن هيكل تحديث التعلم المعزز أكثر أهمية مما كان يُعتقد سابقًا. مع كل نموذج مُنشأ يعمل كسياسة واحدة مستقلة، تُظهر هذه النتائج أن تاريخ التعلم المعزز المخزن يمكن أن يكون مصدرًا قابلاً لإعادة الاستخدام للتوسع، مما يعني أن القدرات المتاحة من دورة التدريب لا تتوقف عند أفضل نقطة تحقق فحسب.