في عصر تتسارع فيه وتيرة الابتكارات في مجال الذكاء الاصطناعي، برز إطار RAPiD (Reward-Guided Consistency Distillation) كأحد الحلول المبتكرة في مجال القيادة الذاتية. يعتمد هذا الإطار على تقنيات تخطيط المسارات المعتمدة على نماذج الانتشار (Diffusion Models)، والتي يمكنها نمذجة سلوك القيادة المتعدد الأنماط. ومع ذلك، كانت عملية إزالة الضوضاء التكرارية قد أوجدت عائقًا زمنيًا للتطبيق الفوري في نظم القيادة الآلية.

يتميز RAPiD بإطار استدلال مدعوم بالمكافآت، حيث يقوم بتحويل نموذج تخطيط تم تدريبه مسبقًا إلى نموذج طلابي يحتاج لعدد خطوات أقل، مع الاحتفاظ بقدرته على توليد المسارات المتعددة الأنماط. يتم تدريب هذا النموذج الطلابي باستخدام خطوات إزالة الضوضاء الحتمية من المعلم المجمد، جنبًا إلى جنب مع نقاط بيانات ذات ضوضاء منخفضة تحافظ على المسارات المتولدة متوافقة مع التوجيهات الخبيرة.

الأهم من ذلك هو أن RAPiD يأخذ الأمن في الاعتبار عبر تدريب مُعلم يتضمن تقنية التعلم القائم على المكافآت من مزيج متوازن من مسارات التسجيل الحقيقية ومسارات تخطيط الانتشار، مما يتيح إشرافًا على مستوى المسار يتجاوز التعلم التقليدي بالتقليد.

خلال عملية النشر، ينتج النموذج الطلابي مسارات متعددة، في حين يقوم المُعلم المدرب باختيار أفضل مسار بناءً على الحالة الكامنة. تشير النتائج على مجموعة بيانات nuPlan إلى أن RAPiD يحافظ على أداء مشابه لمعلم تخطيط الانتشار في الحالات غير التفاعلية، بينما يقلل من زمن الاستنتاج الكامل من 100.91 مللي ثانية إلى 18.41 مللي ثانية، مما يمثل زيادة في السرعة بمقدار 5.5 أضعاف.

أيضًا، سجل RAPiD أعلى درجة إجمالية بين الأساليب المستندة على التعلم في مجموعة بيانات interPlan، مما يدل على تعميم تنافسي في السيناريوهات التفاعلية الطويلة.

بالمجمل، يُظهر RAPiD كيف يمكن لتحسين تخطيط المسارات المدعوم بالمكافآت أن يحول نموذج تخطيط منتشر مُدرّب مسبقًا إلى مُخطط مغلق يتطلب خطوات أقل، مما يقلل من تكلفة الاستنتاج مع الحفاظ على سلامة اختيار المسارات.