في عالم القيادة الذاتية، تعتبر المحاكيات هي المفتاح لتدريب وكالات الذكاء الاصطناعي. وقد شهدت الآونة الأخيرة ظهور محاكيات متقدمة تُدرب وكالات التعلم المعزز (Reinforcement Learning) على نطاق واسع، مما يتيح التعامل مع آلاف السيناريوهات المرورية ومليارات التفاعلات في غضون أيام.

ومع ذلك، فإن سرعة التغذية للمعلومات لم تترافق دائمًا مع كفاءة في استغلال العينات، حيث يتبع التدريب التقليدي طريقة توزيع عشوائي للسيناريوهات، مما يتسبب في استهلاك عدد كبير من التفاعلات في حالات لا تضيف قيمة حقيقية للتعلم. وهنا يظهر دور التعلم المنهجي كحل مثالي، حيث يتيح تحديد الأولويات للسيناريوهات الأكثر أهمية لتحسين استراتيجيات القيادة.

نقدم لكم نظام CL4AD، وهو أول تكامل للتعلم المنهجي مع المحاكيات في مجال القيادة الذاتية، حيث يتم إعادة صياغة اختيار السيناريوهات كمسألة تصميم بيئة غير مراقبة. وقد تم تطوير وظائف فائدة تُشكّل المناهج الدراسية بناءً على معدلات النجاح وواقعية سلوك الوكالات، جنبًا إلى جنب مع وظائف تقدير الندم الحالية.

أظهرت التجارب الواسعة النطاق في GPUDRIVE أن التعلم المنهجي يحقق معدل نجاح بنسبة 99% قبل مليار خطوة مقارنة بأسلوب التوزيع العشوائي، مما يقلل من الوقت المستغرق بنسبة 77%. كما يتفوق هذا النظام على المناهج التقليدية ذات الخصائص الثابتة والديناميكية، باستثناء حالة واحدة عند أكبر نطاق. وأظهر التحليل تحت قيود حسابية أن التعلم المنهجي يُحسن فعالية العينة بنسبة 67%.

ننشر أيضاً كيف تتصرف وظائف الفائدة على نطاق واسع وكيف تتطور السيناريوهات ذات الأولوية خلال عملية التدريب. فرغم التحديات، يبشّر CL4AD بمستقبل مشرق في تحسين التعلم الآلي وتطبيقاته في القيادة الذاتية.