تعتبر المركبات المتصلة والعالية الأتمتة (Connected and Automated Vehicles - CAV) ضمن الاتجاهات الرائدة في مجال تحسين السلامة وكفاءة المرور. تواجه هذه المركبات تحديات كبيرة عند الانضمام إلى قوافل في البيئات المرورية المختلطة، حيث يتمتع السائقون البشريون بأنماط قيادة غير متوقعة.

تقدم الدراسة الجديدة إطارًا شاملاً يستخدم التعلم المعزز (Reinforcement Learning - RL) لتحسين آلية انضمام المركبات إلى القوافل. تُشدد الدراسة على أهمية مراعاة سلامة الركاب وفعالية الانضمام أثناء عملية اتخاذ القرار. حيث أظهرت النتائج أن استخدام خوارزمية Proximal Policy Optimization - PPO يتفوق على خوارزميات Deep Q-Network (DQN) و Double Deep Q-Network (DDQN)، محققةً معدل انضمام يصل إلى حوالي 98% مع انخفاض معدل الاصطدامات إلى أقل من 1%.

اعتمدت الدراسة على نموذج قائم على الوكلاء بالتعاون مع محاكي استحداث الحياة الحضرية (Simulation of Urban Mobility - SUMO) لقياس فعالية هذه الاستراتيجيات. وقد تم دمج عقوبات متعلقة بالمخاطر ضمن وظيفة المكافأة لتحسين الأداء الكلي.

على الرغم من النجاح في الأداء، تظهر النتائج الكثير من التحديات؛ حيث يتطلب الأداء العالي مزيدًا من خطوات اتخاذ القرار، مما يظهر التوازن الصعب المطلوب بين الأمان وكفاءة الانضمام. بالإضافة إلى ذلك، يلعب المنظم الخارجي دورًا حيويًا في الوقاية من التصادمات، لكنه قد يؤثر سلبًا على كفاءة الانضمام.

ختامًا، تبرز هذه الدراسة أهمية الدمج بين السلامة وفعالية الأداء عند تصميم أدوات التحكم المعتمدة على التعلم المعزز لمركبات الجماعات المتصلة في ظروف مرورية مختلطة.