في الآونة الأخيرة، أصبحت نماذج اللغة البصرية (Vision Language Models - VLMs) محوراً مهماً في أنظمة الذكاء الاصطناعي المتعددة الوسائط، حيث تفيد في تنسيق التفكير بين البيانات البصرية والنصية في التطبيقات الواقعية التي تتطلب مزيداً من الأمان. لكن، ورغم انتشارها المتزايد، لا تزال قوة هذه النماذج ضد التهديدات المعادية غير مستكشفة بشكل كافٍ.

في دراستنا الجديدة، تقدمنا بفحص قبل التهديدات التي تستهدف نماذج اللغة البصرية. تعتبر الهجمات المعدلة واحدة من أكثر الطرق شيوعاً لاستغلال هذه النماذج من خلال تشويش المدخلات البصرية. قمنا بدراسة نوعين من الهجمات: الهجمات غير المستهدفة، التي تهدف إلى تعطيل تفسير النموذج للصورة الأصلية، والهجمات المستهدفة التي تسعى لإجبار النموذج على توليد وصف دلالي معين لا يرتبط بالصورة الأصلية.

لقد اقترحنا أسلوب هجوم يعتمد على تحسينات مُركزة على وحدة رؤية نموذج اللغة البصرية بدلاً من معماريتها المتعددة الوسائط بالكامل. هذه الاستراتيجية تقلل بشكل ملحوظ من التكاليف الحسابية والموارد المطلوبة للهجوم مع الحفاظ على فعالية قوية.

من خلال تقيمنا لأسلوبنا الجديد على عدة نماذج مفتوحة المصدر مثل Qwen2.5-VL وGranite-Vision وFastVLM وPhi-3.5-Vision، أظهرنا أن التشويهات الصغيرة التي لا يكتشفها الإنسان يمكن أن تؤثر بشكل كبير على التفسير النصي الذي تنتجه النماذج.

تسلط النتائج الضوء على مدى ضعف نماذج VLM الحديثة أمام التلاعب العدائي، مما يستدعي الحاجة الملحة لتحسين آليات الأمن والصلابة في أنظمة الذكاء الاصطناعي المتعددة الوسائط.