في عالم القيادة الذاتية، يعد استغلال النماذج اللغوية البصرية (VLMs) حلاً ثورياً لكنه يأتي مع تحديات جديدة تتطلب اهتماماً خاصاً. فقد أظهرت الأبحاث الحديثة وجود ثغرات أمنية تحتاج إلى تحصين أكبر. في ورقة بحثية مثيرة تم نشرها، تم تقديم هجوم عدائي يُعرف باسم "الهجوم العدائي الناتج عن التناسق الزمني المكاني" (Spatial Temporal Coherence Adversarial Attack - STCA) ضد النماذج المستخدمة في سياقات القيادة الذاتية.

الركيزة الأساسية لهذه الهجمة تتكون من ثلاث مراحل رئيسية: توسيع الأنماط (Modalities Expansion)، الهجوم المكاني (Spatial Attack)، وهجوم STCA. في المرحلة الأولى، يتم استخدام طريقة اختيار الإطارات الموجهة بتعليقات لتحديد أكثر الإطارات دلالة. بينما في الهجوم المكاني، يتم تصميم اضطراب فعال مع الحفاظ على التشابه العالي. بعد ذلك، يتم تغذية الفيديو المتأثر في المرحلة الأخيرة، حيث يتم التأثير على التناسق الزمني بين الإطارات باستخدام أقنعة موجهة بالحركة.

لقد أجرينا تجاربنا على مجموعات بيانات السيارات الذاتية مثل BDD100K وnuScenes عبر ثلاثة نماذج (VLMs): Video LLaVA-7B، Qwen2.5-VL-7B، ودولفين. وأظهرت نتائج الاختبارات أن الهجوم المكاني حقق نسب نجاح مرتفعة مع الحفاظ على جودة عالية للفيديو. هذه النتائج تكشف أن خصوصية النماذج اللغوية البصرية في سياقات القيادة الذاتية تحتاج إلى تأمين قوي، مما يستدعي استجابة سريعة من الباحثين والمطورين في هذا المجال.

إن الابتكارات في الذكاء الاصطناعي تقدم لأداء القيادة الذاتية إمكانيات هائلة، ولكن مع وجود هذه الهجمات العدائية، يصبح من الضروري للغاية تطوير تدابير الدفاع الفعالة للحفاظ على السلامة والأمان. ما رأيكم في هذه التحديات الجديدة؟ شاركونا أفكاركم في التعليقات!