شهدت نماذج القيادة الذاتية تقدمًا ملحوظًا في السنوات الأخيرة، لكن لا تزال تعاني من قيود رئيسية، أبرزها عدم القدرة على محاكاة التنوع السلوكي الذي يتمتع به البشر أثناء القيادة. يعد فهم نوايا المستخدم من التفاعلات البشرية والسياقات البيئية أحد أكبر التحديات التي تواجه هذه الأنظمة.

للتغلب على هذه التحديات، تم اقتراح إطار جديد يدمج التعلم المعزز (Reinforcement Learning) مع تخطيط حركة ذي رؤوس متعددة (Multi-Head Diffusion)، والذي يعتمد على فهم دلالي مدعوم بنماذج لغات كبيرة (Large Language Models). يسمح هذا النظام بفهم ديناميكي واضح لنوايا المستخدمين وإنتاج مسارات متنوعة تتماشى مع تفضيلاتهم.

يعتمد إطار العمل الجديد على نهج تدريبي ذو مرحلتين، حيث تضمن المرحلة الأولى التعلم بالمحاكاة لتحقيق تخطيط آمن وعالي الجودة. أما المرحلة الثانية، فتستخدم تحسين السياسة النسبي المجمع (Group Relative Policy Optimization) لضمان توافق كل مجموعة سياسية مع تفضيلات المستخدم. أظهرت الاختبارات على معيار nuPlan أداءً تنافسيًا بينما تحافظ في الوقت نفسه على متطلبات التخطيط في الزمن الحقيقي.

هذه التطورات تسلط الضوء على أهمية تركيز التكنولوجيا الحديثة على تلبية احتياجات المستخدمين وتعزيز تجارب القيادة الذاتية لتصبح أكثر تخصيصًا وسلاسة.