يشكل تنسيق المركبات الذاتية في التقاطعات غير المجهزة بإشارات تحديًا كبيرًا لأنظمة التعلم المعزز المتعدد الوكلاء (MARL)، والتي تعاني عادة من صعوبة التعامل مع فضاءات العمل المعقدة والاعتماد على معلومات متميزة أو تصميمات وكلاء قاسية.

لذا، تقدم ورقة بحثية جديدة نظامًا مبتكرًا يُعرف باسم "نظام بروتوكول الوكيل الرئيسي" (Master-Agent Proto-plan System أو MAPS)، وهو هيكلية متقدمة للتعلم العميق المعزز (DRL) تهدف إلى تحسين التعاون بين المركبات الذاتية. يعتمد تصميم MAPS على مفهوم الوكيل الرئيسي الذي يُنتج تمثيلًا مستمرًا مضغوطًا يُعرف بـ"بروتو-خطة" (proto-plan)، والذي يُشفر استراتيجية تنسيق عالمية.

يساهم الوكلاء العمال في دمج هذا التمثيل مع الملاحظات المحلية لتنفيذ التحكم الخاص بكل مركبة، مما يفصل بين النية الاستراتيجية والتنفيذ التكتيكي، مما يمكّن من تحسين كل جزء من النظام بشكل مستقل. كدليل على كفاءة آلية التنسيق هذه، تم اختبار MAPS عبر 72 تكوين تقاطعي في بيئة HighwayEnv.

نجح النظام في تحقيق تنقل خالٍ من التصادمات مع تقليل متوسط ​​الزمن المستغرق في الرحلة بشكل كبير، متفوقًا بذلك على الحلول الحالية في السوق. الأهم من ذلك، أظهرت خطط البروتو المكتسبة قدرة كبيرة على التعميم؛ فقد حقق النظام المدرب مع ثلاثة وكلاء نسبة نجاح بنسبة 94% عند نشره بشكل مفاجئ في سيناريوهات من خمسة وكلاء، مما يؤكد أن التعلم الهرمي القائم على بروتو-خطط يوفر إطارًا واعدًا لتنسيق المركبات المتعددة.