في دراسة مثيرة نُشرت على منصة arXiv، يتم تناول ظاهرة غريبة تتعلق بنماذج الرؤية-لغة (Vision-Language Models - VLMs). يُظهر البحث أن التعديلات العدائية المستهدفة يمكن أن تقلل من خسارة نموذج VLM أثناء التدريب لتصبح قريبة من الصفر، ولكن عند السماح للنموذج بالتوليد الحر، نجد أنه يقدم الوصف الصحيح الأصلي دون أي أثر للتعديل.

تُعرف هذه الظاهرة بالفجوة بين التدريب والتنبؤ (train/inference gap)، وتم دراسة آلياتها بشكل دقيق من خلال نموذج Qwen2.5-VL-7B-Instruct باستخدام هجوم (PGD) الخاضع للرقابة على 200 صورة من مجموعة بيانات COCO.

أولاً، أظهرت النتائج أن إحصائيات بيكسل الصورة على مستوى الصورة، بما في ذلك مقياس استهداف يعتمد على القوام، ليس لها أي قدرة تنبؤية تُذكر في تحديد أي الصور تتعرض للتعديل.

ثانياً، عبر استخدام عدسة اللوجيت، اكتشف الباحثون أن الفجوة محصورة في خطوة واحدة داخلية، حيث يحتفظ ترتيب الرمز المستهدف بنفس المرتبة لجميع الصور وظروفها.

ثالثاً، تتبع ترتيب الرمز المستهدف عبر جميع طبقات الموديل يكشف أن المشفر البصري يُفسد تمثيل كل صورة بنسبة مماثلة، بينما يقوم موصل اللغة بتحكيم تلك الإشارات بشكل مختلف، مما يبرز الإشارات الفاسدة في الصور الضعيفة ويقوم بكبتها في الصور المقاومة.

تسلط هذه النتائج الضوء على أن القدرة على مقاومة التعديلات العدائية في نماذج VLM تعتمد بشكل كبير على نموذج اللغة، وليس على المشفر البصري. هذه الاكتشافات تحمل تأثيرات مباشرة على كيفية تقييم موثوقية أنظمة VLM ووسائل الدفاع المستخدمة لها، مما يمهد الطريق لفهم أفضل للذكاء الاصطناعي وكيفية التعامل مع نقاط ضعفه.