في عالم الذكاء الاصطناعي، تُعتبر قدرة النماذج على التعلم من أخطائها والتكيّف مع الظروف المتغيرة أمراً حيوياً. تقدم التقنية الجديدة المسماة SMOPD (Selective Masking for On-Policy Distillation) خطوة مفصلية من خلال معالجة أحد أكبر التحديات: تأثير "سجل الأخطاء" في التعلم الذاتي.

تُظهر الأبحاث أن النماذج متعددة الدوران قد تفقد مرونتها عند تكوين استجابات غير صحيحة في مراحل سابقة من الحوار. نظراً لأن هذه الأخطاء تؤثر على المخرجات اللاحقة، جاءت الحاجة إلى تطوير آلية قوية تُعزز من دقة النتائج.

تعمل تقنية SMOPD من خلال اعتماد تسلسل استجابات يمكن من خلاله تصنيف مواقع الرموز وفقاً لمستويات عدم اليقين. يتم تقليص الرموز ذات مستوى عدم اليقين المنخفض بنسبة 20% من الخسارة العامة أثناء عملية التعلم، وهذا يزيد من احتمال حصول نموذج اللغة على استجابات دقيقة.

وفقاً للنتائج، أظهرت تقنية SMOPD تحسينات واضحة في دقة العرض SHARDED في نماذج Qwen3، مقارنةً بالطرق التقليدية. كما تشير الإحصائيات إلى أن استخدام عدم اليقين عند مستوى الرموز يمكن أن يقدم إشارات استقرار أكثر موثوقية.

بفضل هذه الابتكارات، يفتح SMOPD آفاقاً جديدة لمستقبل الذكاء الاصطناعي ويضع أساساً متيناً للتطويرات المستقبلية في نماذج التعلم الذاتي.