في تطور تقني جديد في مجال الذكاء الاصطناعي، تم تقديم نظام RetireOPD (Self-Retiring On-Policy Distillation)، الذي يمثل ثورة في طرق التعلم المعزز (Reinforcement Learning). يعتمد هذا النظام على فكرة فريدة تتمثل في تعزيز التعلم الذاتي للطلاب دون الاعتماد الكبير على مهارات المعلمين.

يعمل النظام من خلال تقديم تغذية راجعة دقيقة على مستوى الرموز من معلم يمتلك مهارات متقدمة، مما يتيح للطلاب الاستفادة من هذه المهارات دون الحاجة إلى تحسين مدخلاتهم. ومع ذلك، تم اكتشاف نقطتان أساسيتان في المهام الوكالية توضحان أن المعلومات المُتميزة لا تجعل المعلم دائمًا موثوقًا، وأن فائدة إشراف المعلم تعتمد على المرحلة.

لذلك، تم تطوير RetireOPD الذي يقوم أولاً بتحسين معلم غير مقيد بالمهارات باستخدام مكافآت بيئية، ثم يقوم بتدريب الطلاب الذين لا يمتلكون مهارات بالتوازي مع التعلم المعزز وأسلوب OPD.

تقوم RetireOPD بتبني مفهوم التقاعد التكيفي (Adaptive Retirement)، حيث يتخلى الطالب عن المعلم من تلقاء نفسه بمجرد أن يتوقف الفرق بين أدائهم عن الانكماش ويصل إلى نسبة مستهدفة من معدل نجاح المعلم. ومن خلال التجربة على نماذج Qwen2.5 التي تتراوح من 1.5 مليار إلى 7 مليار، حققت RetireOPD تحسنًا في معدل نجاح ALFWorld بنسبة تتراوح بين 14.1% إلى 18.8%، ودقة WebShop بنسبة من 11.8% إلى 19.0%، متفوقة على معلمها غير المقيد بالمهارات في جميع إعداداتها.

ما يزال RetireOPD يمثل خطوة رائدة إلى الأمام، حيث يجسد المستقبل المشرق لتطوير نظام تعلم أكثر ذكاءً وفعالية. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.