شهدت نماذج توليد الفيديو تطوراً سريعاً في السنوات الأخيرة، مما أدى إلى زيادة استخدام نماذج تحويل الصورة إلى فيديو (Image-to-Video). وعلى الرغم من أن هناك تقدمًا كبيرًا في اكتشاف الفيديوهات التي تُنتج بواسطة الذكاء الاصطناعي، إلا أن الدفاعات الاستباقية ضد نماذج تحويل الصورة إلى فيديو ما زالت بحاجة إلى المزيد من الاستكشاف.

تسعى العديد من الدفاعات الحالية إلى مواجهه الهجمات الاستباقية، ولكنها تعتمد بشكل كبير على الهجمات العدائية القائمة على المعايير (gradient-based adversarial attacks)، مما يتطلب أن يمتلك المدافعون وحدات معالجة رسومية (GPUs) ذات موارد ذاكرة ضخمة (VRAM) لتوليد أمثلة عدائية.

لمعالجة هذه القضية، نقدم I2VShield، وهو أسلوب لحماية الخصوصية يعتمد على الهجمات العدائية التوليدية (generative adversarial attacks) مع تخصيصه لنماذج تحويل الصورة إلى فيديو المستندة إلى المحولات الانتشارية (Diffusion Transformer).

يتكون الأسلوب المقترح من مكونين رئيسيين: (1) إطار توليد الاضطراب التكيفي للنص، الذي يدمج التعلم العدائي لتقليل العبء الحسابي مع الحفاظ على عدم وضوح الرؤية؛ و(2) هجوم تعطيل الانتباه المتعدد الوسائط غير المستهدف (Multimodal Attention Disruption - MAD) الذي يستغل الثغرات الجوهرية في نماذج تحويل الصورة إلى فيديو المستندة إلى المحولات الانتشارية، مما يزيد من انحراف ميزات الانتباه الداخلية عن حالات النظافة الخاصة بها.

توضح التجارب المكثفة أن هذه الطريقة تحقق أداء حماية تنافسي عالٍ عبر مجموعة متنوعة من البيانات ونماذج تحويل الصورة إلى فيديو المستندة إلى المحولات الانتشارية، خاصةً في تعطيل التناسق الزمكاني، بينما تقلل بشكل كبير من التكاليف الحسابية.

نحن في عصر يتسارع فيه تطوير الذكاء الاصطناعي، وعلينا أن نكون مستعدين لمواجهة التحديات التي تأتي مع ذلك. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.