في عالم الذكاء الاصطناعي، تعتبر نماذج القيادة المعتمدة على اللغة والرؤية (Vision-Language Models) إحدى التقنيات الواعدة التي تعد بتوفير استقلالية تفسيرية من النهاية إلى النهاية. حيث تقوم هذه النماذج أولاً بإنتاج تفكير بلغة طبيعية، ثم تتجه نحو توقعات التخطيط للحركة. لكن يا تُرى، هل يعتمد التخطيط فعلياً بالأساس على هذا الفكر، أم أن هناك انفصالاً بينهما؟

للتحقيق في هذه المسألة، تم تطوير مجموعة بيانات جديدة باسم "DriveMind"، تشمل أسئلة وإجابات بصرية متعلقة بالقيادة وتدمج بين التخطيط والتفكير المتسلسل (Chain-of-Thought) وذلك بالتزامن مع مصادر بيانات من nuPlan. تظهر العملية الجريئة لتحويل البيانات كيف يتم فصل الإشارات السابقة عن تلك التي تحتاج إلى تفكير، مما يسهل تنفيذ اختبارات دقيقة.

بعد تدريب نماذج تمثيلية باستخدام تقنيات مثل Supervised Fine-Tuning وGroup Relative Policy Optimization، تم تقييم الأداء وفقاً لمعايير nuPlan. للأسف، أظهرت النتائج وجود انفصال متكرر بين التفكير والتخطيط: إزالة المعلومات المتعلقة بالملاحة (ego/navigation priors) أدت إلى انخفاض كبير في معدلات التخطيط، في حين أن إزالة التفكير المتسلسل لم تُحدث إلا تغييرات طفيفة.

عبر تحليل الانتباه (Attention Analysis)، تبين أن التخطيط كان يركز بشكل أساسي على المعلومات السابقة بدلاً من التفكير المتسلسل. بناءً على هذه النتائج، قدمنا فرضية "فصل التفكير والتخطيط"، تشير إلى أن التفكير المستخلص أثناء التدريب يعد نتاجاً ثانوياً، وليس وسيطاً محورياً.

لمساعدة المجتمع في هذا المجال، تم تقديم أداة تشخيص جديدة لا تعتمد على التدريب، تقيس اعتماد النموذج على المعلومات السابقة من خلال تقييم قوته في التخطيط عند حدوث تغييرات طفيفة في المدخلات. هذه الأداة، بالإضافة إلى مجموعة البيانات الجديدة، تمثل خطوة هامة نحو تطوير نماذج مستقبلية أكثر موثوقية وتحقيق فهم أفضل للعلاقات المعقدة بين التفكير والتخطيط.