في عالم الذكاء الاصطناعي، حققت نماذج تحويل النص إلى صورة (T2I) تقدماً ملحوظاً في إنشاء محتوى بصري عالي الجودة. ومع ذلك، تبقى هذه النماذج عرضة للاستخدامات الاعتيادية، خاصة في إنتاج محتويات غير مناسبة (Not-Safe-For-Work). في الوقت الحالي، تعتمد معظم الهجمات التي تحاول تجاوز دفاعات هذه النماذج على أساليب تقليدية مثل هندسة الأوامر heuristics أو تحسين الصناديق السوداء black-box optimization، وهو ما يعتبر نهجاً بدائياً يغفل عن المعلومات الغنية المتضمنة في أوضاع الفشل المتنوعة مثل الرفض النصّي أو الحجب البصري وعمليات التنظيف المعنوي، مما يؤدي إلى استكشاف غير كفء وانهيار معنوي خطير.
لذا، تم اقتراح إطار عمل جديد يُعرف بـ MIND، الذي يعيد صياغة التحديات المرتبطة بإنشاء الأوامر العدائية كمسألة استدلال عن حالة الاعتقاد على الدفاعات الكامنة. بدلاً من البحث الأعمى عن الأوامر التي تتجاوز الدفاعات، يقوم MIND بنمذجة آليات الدفاع الكامنة في النظام المستهدف عن طريق تفسير التغذية الراجعة المتعددة الأنماط كإشارات ذات كثافة عالية. يتضمن هذا الإطار ثلاثة مكونات رئيسية: 1) قاضي متعدد الأنماط Multi-modal Judge لتفكيك التغذية الراجعة بدقة، 2) مُصنّف دفاعات Defense Profiler لتحديث الاعتقادات بشكل تكراري، و3) وحدة ذاكرة علوية Meta-Memory لاسترجاع استراتيجيات الهجوم الفعالة تاريخياً.
يجتمع كل من هذه المكونات ضمن عملية تحسين مدفوعة بالتفكير، مما يمكّن من إنشاء هجمات تجاوز متسقة مع المعاني والسيناريوهات. تم تنفيذ تجارب واسعة على معيار I2P، حيث تُظهر النتائج فعاليات عالية لإطار عمل MIND. تحت ستة إعدادات للدفاع تمثل قيد المعالجة المسبقة والمعالجة اللاحقة على نموذج Stable Diffusion v1.5، تحقق MIND معدل نجاح هجمات يصل إلى 95.62%، متجاوزاً بكثير الأساليب الحالية. كما تم تأكيد فعالية الإطار المقترح عبر أربع أنظمة تجارية شهيرة، مسجلاً أعلى معدل نجاح 91.58% على نموذج Wan-2.5.
تحطيم الحواجز: إطار جديد لتحسين اختراق نماذج تحويل النص إلى صورة
تقدم الأبحاث الجديدة إطار عمل MIND الذي يعيد صياغة عمليات الهجوم ضد نماذج تحويل النص إلى صورة (T2I) ليكون أكثر فعالية. الإطار يستخدم أساليب متقدمة لفهم دفاعات الأنظمة المستهدفة بمعدل نجاح هجمات مذهل يصل إلى 95.62%.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
