في عالم الذكاء الاصطناعي الحديث، تسعى الفرق البحثية دائماً لتحسين الأداء وكفاءة النماذج المتطورة. إحدى الفرضيات الجديدة المثيرة هي استخدام تقنيات التقطيع (Distillation) بالتزامن مع التعلم المعزز لتحسين أنظمة إعادة ترتيب التعليمات.\n\nتمثل أنظمة إعادة ترتيب التعليمات أداة فعّالة ضمن مجالات مثل معالجة اللغة الطبيعية (Natural Language Processing) حيث تسهم في تحديد ترتيب الأولويات لمجموعة من التعليمات. ومع ذلك، كانت هناك تحديات في الاعتماد على الأساليب التقليدية التي تعتمد على بيانات ثابتة من المعلمين (Teachers) لتحقيق الأداء الأفضل.\n\nتمكن الباحثون من تطوير إطار عمل جديد من مرحلتين يجمع بين تحسين المعلم المعتمد على بيانات خارجية (Off-Policy Teacher Optimization) وتقطيع الطلاب المعتمد على البيانات الحالية (On-Policy Student Distillation). في المرحلة الأولى، تم تعزيز أداء النموذج المعلم الذي يحتوي على 4 مليار معلمة باستخدام استراتيجيات التعلم المعزز مع توفير تعليقات مستندة إلى نماذج اللغات الضخمة (Large Language Models). بينما تركز المرحلة الثانية على تحسين أداء نموذج الطالب بحجم 1 مليار معلمة، مما يسمح له بالتفاعل مع تقييمات التعليمات بشكل أكثر مرونة.\n\nوقد أظهرت النتائج أداءً لافتًا حيث حقق النموذج الطلابي الجديد نسبة 0.7670 في مقياس النسبة المئوية للموضح الجذري (nDCG@6)، محققًا زيادة تقدر بـ 4.6 نقاط عن الأساليب السابقة. بالإضافة إلى ذلك، فإن نتائج المقارنات السليمة مع نماذج تقطيع للأساليب التقليدية عند تسجيل أداء مرتفع مشجعة لجهود الباحثين في هذا المجال.\n\nإضافة إلى ذلك، تم استخدام نفس الأسلوب التدريبي لتحسين خلفيات طلابية متعددة المعمارية، مما يُظهر قدرة التقنيات الجديدة على التكيف والابتكار عبر نماذج متعددة. في النهاية، تحقق النموذج الناتج من 1 مليار معلمة نسبة 0.7624 في تقييم دقيق للغاية للارتباطات (nDCG@6) مع تقديم تقييم الجودة مقابل الكفاءة، مما يمهد الطريق لاستراتيجيات مستقبلية أكثر ابتكارًا في مجال الذكاء الاصطناعي.