في الآونة الأخيرة، شهدنا تقدمًا سريعًا في نماذج الرؤية-لغة (Vision-Language Models)، مما أثار اهتمامًا متزايدًا في تطبيقها ضمن مجالات القيادة الذاتية. ومع ذلك، كانت هناك فرضية سائدة تفيد بأن الأجيال المتعاقبة من هذه النماذج ستعمل دائمًا على تحسين الأداء في القيادة. للتأكد من صحة هذه الفرضية، تم تطوير LightEMMA، وهو إطار عمل طولي يهدف إلى تقييم أداء القيادة الذاتية لهذه النماذج.

يتميز LightEMMA بروتوكول تقييم موحد وخفيف الوزن، يقوم بتقييم القدرة العميقة لكل نموذج على القيادة دون الحاجة إلى ضبط دقيق خاص بالنموذج أو تغييرات معمارية أو هندسة للدعوات. تم استخدام هذا البروتوكول لتقييم 15 نموذجًا من خمس عائلات رئيسية على معيار النماذج التنبؤية nuScenes.

أظهرت النتائج التجريبية أنه على الرغم من زيادة حجم النماذج وتحسن قدراتها على الاستدلال العام، إلا أن الأجيال المتعاقبة من نماذج الرؤية-لغة لم تحقق تحسينات متسقة في الأداء القيادي. كما تم تحليل سيناريوهات القيادة وكشف عن أنماط فشل متكررة، تتضمن الاعتماد المفرط على الأفعال التاريخية وصعوبة التوفيق بين الإشارات البصرية المتضاربة.

تعتبر هذه النتائج ضرورية وتسلط الضوء على أهمية التكيف مع المجالات الخاصة لتعزيز سلامة نظم القيادة الذاتية المبنية على نماذج الرؤية-لغة. لمزيد من التفاصيل، يمكنكم الاطلاع على الشيفرة المصدرية المتاحة على GitHub.