لقد شهدنا في الآونة الأخيرة انتشار نماذج تحويل النص إلى فيديو (Text-to-Video Models) بشكل واسع، مما أثار قلقًا متزايدًا بشأن قدرتها على مقاومة هجمات الاختراق (Jailbreak Attacks). هذه الهجمات التي تم تبنيها عادة من أساليب تحويل النص إلى صورة (Text-to-Image)، تواجه العديد من التحديات عند تطبيقها على نظم تحويل النص إلى فيديو. مع ذلك، فإنها لا تستفيد بالكامل من التناسق الزمني (Temporal Consistency)، وهو خاصية فطرية في توليد الفيديو.

بالإضافة إلى ذلك، تتطلب هذه الطرق تحسينات معقدة في استعلامات الفيديو، مما يجعلها غير عملية في سيناريوهات الاختراق الأسود (Black-box scenarios). الأساليب الحالية تعتمد على البحث عن إشارات محلية استدلالية، لكنها تفتقر إلى استراتيجيات استكشاف منظمة.

لتجاوز هذه القيود، نقدم BSB، وهو إطار عمل هيكلي وفعال للاستعلام لاختراق نماذج تحويل النص إلى فيديو. تعتمد هذه الطريقة على التناسق الزمني من خلال تشفير النوايا الضارة كفترة انتقال بين حالتين آمنتين. تحت هذا الجانب، تستهدف الهجمات الأزواج الحدودية التي من المرجح أن تنتج إطارات وسيطة غير آمنة خلال عملية توليد الفيديو.

بدلًا من تقييم جميع الأزواج المرشحة داخل فضاء الفيديو الذي يتطلب تكلفة حاسوبية باهظة، يقوم BSB بتنفيذ بحث شجرة مونت كارلو (Monte Carlo Tree Search) في فضاء نصي أرخى، ويقوم بضبط نتائج البحث بانتظام مع تقييمات سطحية على مستوى الفيديو.

قمنا بإجراء تجارب شاملة على نماذج تحويل النص إلى فيديو الرائجة مثل Veo 3.1، Sora 2، Seedance وKling v1. أظهرت النتائج أن BSB يتفوق على جميع المعايير الحالية، حيث حقق زيادة متوسطة بنسبة 18.6% في معدل نجاح الهجوم مقارنةً بأقوى المتنافسين. تؤكد النتائج على أهمية التناسق الزمني كمنطقة هجوم لا تحظى بالاهتمام الكافي، وتوضح أن البحث المنظم يعزز اكتشاف الثغرات وبالتالي يصبح فعّالًا رغم القيود على استعلامات البحث.