في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغة الكبيرة (Large Language Models) أحد أبرز الابتكارات التي تُغير مشهد البحث والتطوير. مؤخرًا، قدم باحثون تقنية جديدة تُعرف باسم التعلم الذاتي على السياسات المعززة (Bootstrapped On-Policy Self-Distillation أو B-OPSD) التي تهدف إلى تحسين أداء هذه النماذج بشكل كبير.

تقوم هذه الطريقة بتغيير طريقة تعلم النموذج من خلال استخدام معلومات ذات جودة أعلى، مما يسمح له بتحسين دقة توقعاته. إذ تستند الفكرة الأساسية إلى استغلال تقدم النموذج الحالي في التعلم لإعادة تدوير معلومات التعلم السابقة في مُعلمٍ أقوى.

بدلاً من الاعتماد على سياسة أولية قديمة، يتم تدريب النموذج بشكل مؤقت للحصول على مُعلمٍ مستقبلي. يُمكن لهذا المُعلم الجديد تحسين نتائج التعلم من خلال توليد مسارات موثوقة أكثر وتهدف إلى توفير أهداف معلوماتية لمستويات التوكن (token-level) أثناء استئناف التعلم.

أظهرت التجارب التي أُجريت على قدرات الاستدلال الرياضي لنموذجي Qwen3-4B وQwen3-8B تحسنًا ملحوظًا في الأداء، حيث تم تسجيل زيادات في النتائج تتراوح بين 27.50 إلى 41.30، ومن 48.80 إلى 64.44 في بيئة تستخدم المعلومات المميزة.

تشير النتائج إلى إمكانية استخدام التقدم التعليمي المستقبلي كوسيلة لتحسين النموذج، مما يتيح له الحفاظ على المعرفة المكتسبة أثناء البناء على إنجازاته.

تعتبر هذه التقنية خطوة مهمة نحو نماذج أكثر استقلالية وقدرة على التعلم الذاتي، مما يمهد الطريق لمزيد من التطورات في عالم الذكاء الاصطناعي. هل لديكم تساؤلات حول كيف يمكن للتعلم الذاتي أن يؤثر على تقدم الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!