في عالم الذكاء الاصطناعي والتعلم المعزز، تعتبر الرسائل التعليمية (Training Prompts) أداة رئيسية تؤثر بشكل كبير على فعالية السياسات التعلمية. في الدراسة الأخيرة، تم تسليط الضوء على اختلاف المعلومات التي توفرها هذه الرسائل، حيث نجد أن بعضها مشبع بمعلومات كثيرة بينما الآخر يصعب فهمه مما يؤثر سلبًا على العملية التعليمية. للأسف، حتى تحت أساليب التدريب القياسية، يُخصص نفس الميزانية لكل الرسائل التعليمية، مما يؤدي إلى نتائج غير متساوية.

للتغلب على هذه التحديات، تم اقتراح إطار عمل يعتمد على الهيكلة الإرشادية المعتمدة على نقاط الاستكشاف (Exploration Potential Score - EPS). هذا الإطار يقوم بتكييف توزيع الرسائل التعليمية بشكل ديناميكي طوال عملية التعلم المعزز، مما يعني أن النظام يصبح أكثر ذكاءً في توجيه التعليمات للموارد المتاحة.

تم تطوير هذا النظام على أساس نظرية تحسين السياسات باستخدام قيود KL، ويعتمد على إحصاءات المجموعة الحالية من العمليات لضمان كفاءة الاستخدام دون زيادة الحمل.

بدلاً من التخلص من الرسائل التي تقل فيها الفائدة، يمكن للمدرس النموذجي إعادة صياغة هذه الرسائل مع الحفاظ على نية المهمة الأصلية، مما يجعل التدريب المستقبلي أكثر فعالية عن طريق تحسين البيانات بدلاً من مجرد تكرار النتائج.

استخدمت هذه الطريقة مع تقنيات GRPO على قاعدة بيانات Geo3K وMMK12، وقد أظهرت النتائج تفوقًا مستمرًا على المعايير القياسية، حيث تم تحقيق تحسينات نسبية تصل إلى 9.7% في المجال، مع مكاسب إضافية وصلت إلى 11.5% على MathVision و11.1% على MMMU-Pro.

من المؤكد أن هذه الابتكارات ستعيد تعريف كيفية تدريب النماذج متعددة الأبعاد في المستقبل، وننتظر المزيد من التطورات التي ستحسن استخدامنا لتقنيات الذكاء الاصطناعي.