في عالم متسارع نحو الابتكار، يبرز مفهوم جديد يُعرف بـ SceneJail، والذي يمثل ثورة في فهم كيفية استغلال الثغرات الأمنية في نماذج اللغة متعددة الوسائط (Video Multimodal Large Language Models - Video-MLLMs). هذه النماذج، التي تدعم التفكير والتحليل القائم على إدخال الفيديو، أظهرت ضعفاً ملحوظاً أمام هجمات "السجن" (jailbreak attacks) التي تطلب ردود فعل تتعارض مع السياسات المتبعة.

في السابق، كانت الهجمات على نماذج الفيديو تركز بشكل رئيسي على كيفية تقديم الاستفسارات الضارة بصرياً، مما جعل الفيديو مجرد حامل للرسالة. ومع ذلك، تشير دراسة جديدة إلى أن السيناريو المحيط بالفيديو يمكن أن يلعب دوراً حاسماً في الاستجابة الأمنية.

تعتمد منهجية SceneJail على مكونين متناسقين؛ الأول هو "بناء السيناريو التكيفي" الذي يقوم بالبحث الديناميكي عن سيناريو مناسب يتناسب مع الاستفسار الضار، والثاني يُعرف بـ "بحث الموجه الواعي بالسيناريو" الذي يستخدم ملاحظات الاستجابة لتحسين الإرشادات النصية بناءً على السيناريو المختار.

قدمت تقييمات شاملة على مجموعتي بيانات HADES وSafeBench ضد ثمانية نماذج Video-MLLMs، بما في ذلك نموذجين خاصين هما GPT-4.1 وGemini3.5-Flash. أظهرت النتائج أن SceneJail-F، الذي يقدم الاستفسار الكامل بشكل مستمر، يحقق معدلات نجاح في الهجوم تصل إلى 91.5%، مُتفوقاً على أقوى القواعد السابقة بنسبة 29.1 نقطة.

وفيما يتعلق بـ SceneJail-S، الذي يوزع الاستفسار على إطارات متتالية، فقد أظهر مرونة كبيرة أمام الدفاعات الحالية، محافظاً على معدل نجاح يصل إلى 72.3% حتى في ظل تصفية الصور الصارمة.

تُعد هذه النتائج خطوة هامة لفهم إمكانيات ونقاط ضعف نماذج الفيديو المتعددة الوسائط، وتثير تساؤلات حول كيفية تعزيز الأنظمة ضد مثل هذه الهجمات الذكية. هل تعتقد أن الأبحاث المستقبلية ستساعد في تحسين مستوى الأمان لهذه النماذج؟ شاركنا رأيك في التعليقات!