في خطوة ضخمة نحو فهم أعمق للثغرات الأمنية في نماذج الرؤية واللغة (Vision-Language Models) (VLMs)، تم تقديم تقنية جديدة تُعرف باسم 'الأمثلّة المجمعة للنقاط والنصوص' (Joint Pixel-Prompt Optimization) والتي تغيّر الطريقة التي نتعامل بها مع الهجمات الاستنزافية.

تقليديًا، كانت هذه الهجمات تعتبر من منظور أحادي، تركز على إبقاء التهديدات ثنائية، وتعتبر فرع الصورة هو السطح الأساسي للتحسين، متجاهلة جوانب مهمة من المدخلات التي يمكن الاستفادة منها. لكن الدراسة الجديدة تفتح آفاقًا جديدة من خلال تناول المشكلة كعملية تحسين متعددة، حيث تتعاون المعلومات المرئية وغير المرئية على حد سواء.

تسهم 'JPPO' في زيادة فعالية الهجمات من خلال الجمع بين تلاعبات الصور النصية، مما يؤدي إلى زيادة ملحوظة في تكاليف معالجة المعلومات. في تجربتنا، يمكننا رؤية تحسين يصل إلى 4.6 مرة في زمن الاستجابة و5.3 مرة في استهلاك الطاقة لنموذج Qwen2.5-VL-7B، و36.6 مرة في زمن الاستجابة مع 32.7 مرة في استهلاك الطاقة لنموذج BLIP-2.

تُظهر هذه النتائج تفوقًا ملحوظًا على طرق سابقة، مما يشير إلى وجود ثغرات هيكلية في الدفاعات الحالية. هذه الكشفات لا تبين فقط ضعف البنى التحتية القائمة، بل تدعو أيضًا إلى إعادة التفكر في متطلبات الأمان لعمليات النشر المتعددة النماذج.

لم يعد يمكن اعتبار الأمان مطلبًا ثانويًا، بل يجب أن يُعتبر عاملاً أساسيًا في تصميم النماذج المعقدة والتي تتضمن مدخلات متعددة. ما هي تداعيات هذه النتائج على المستقبل؟ شاركونا آراءكم في التعليقات!