في خطوة نوعية نحو تعزيز فعالية التعلم المعزز، تم تقديم مفهوم Open-MOPD (Multi-Teacher On-Policy Distillation) كوسيلة جديدة لمعالجة عدم التوازن في قدرات المعلمين في النماذج الذكية. يهدف Open-MOPD إلى دمج خبراء التعلم المعزز المتخصصين في مجال معين ضمن نموذج عام واحد، مما يوفر إشرافاً دقيقاً على مستوى الرموز.

على الرغم من نجاحه العملي، إلا أن الديناميات المتعلقة بكيفية تحسين وتكامل قدرات المعلمين متعددين لا تزال غير مفهومة بشكل كامل، والكثير من الوسائل المتاحة غير قابلة للتكرار علمياً. من خلال العمل الحالي، تم إنشاء معيار تحكم لـ M-OPD على نموذج SmolLM3-3B-Base مع توجيه أوراق، مما يعزل تكامل القدرات عن غموض التوجيه.

أظهرت الأبحاث وجود فجوة بارزة في تكامل القدرات، حيث يحقق M-OPD القياسي فقط 35.6% من الهامش المتاح مقارنةً بمجموعة أوركل محكومة، مع تفكك شديد في المهام الواضحة مثل اتباع التعليمات. هنا، تم توضيح أن هذا الفشل لا يعود إلى صراع التدرجات، بل إلى سوء تخصيص ميزانية التحسين على مستوى الرموز.

لفهم هذه المشكلة، حدد الباحثون ثلاثة عوامل رئيسية تؤثر على التوازن: الفروقات الهيكلية في أطوال التسلسلات عبر المجالات، الانجراف الديناميكي في التقارب بسبب معدلات التعلم غير المتجانسة، وقدم المكافآت متعددة الخطوات من التحديثات غير المتزامنة للسياسات. لحل هذه الإشكالات، تم تقديم Open-MOPD كإطار مدروس يتضمن موازنة توزيع الرموز، وتخصيص ميزانية ديناميكية واعية للفجوات، وتحديث مكافآت الطلاب. تسمح هذه التدابير بإعادة التوازن بين المجالات المختلفة، وزيادة معدل التعافي من 35.6% إلى 83.4% في نموذج واحد قابل للنشر.

نحن فخورون بالإعلان عن فتح مصادر منهج التصحيح الكامل عبر الإنترنت، بما في ذلك مسارات التدريب وأدوات التقييم، مما يسهل الوصول الأكاديمي لهذا التطور الرائد.