في عالم الذكاء الاصطناعي (Artificial Intelligence)، تظل نماذج الرؤية-اللغة (Vision-Language Models) عرضة للهجمات، حيث تُعتبر تصنيفات الأمان (Safety Classifiers) الدفاعات الأساسية المعتمدة. ومع ذلك، تعتمد هذه الدفاعات على الشكل السطحي للمدخلات بدلاً من معناها الحقيقي. يمكن أن يتجاوز الطلب الضار هذه الحواجز إذا تم إعادة ترميزه باستخدام مجموعة من الأساليب مثل نظرية المجموعات أو المنطق الرسمي.

للتصدي لهذه الثغرات، تم اقتراح جهاز Amplifier قادر على استعادة وفك تشفير المحتوى، حيث يقوم بتحويل نصوص الصور وإعادة صياغة النصوص المشفرة قبل أن تصل إلى تصنيف الأمان. هذا الابتكار يُمكن أي مصنف متاح من فحص الطلب الحقيقي بدقة أكبر.

لقد تم تقييم أداء هذا Amplifier ضد مجموعة من 11 هجوماً، حيث أظهر نتائج مدهشة تضاعف بها متوسط الأداء بمعدل 3.5 مرات. ومع ذلك، وعلى الرغم من هذه التحسينات، لا يزال هناك فجوة في الأمان، حيث تفشل العديد من الدفاعات المعتمدة في معالجة الهجمات بشكل كامل، حيث تكشف النتائج أن حوالي 63-65% من الطلبات تظل غير محمية.

بالإضافة إلى ذلك، تم تنفيذ طبقة Reguard إضافية لتقليل الفجوة المتبقية، رغم أنها تؤدي إلى ارتفاع معدلات الرفض الخاطئ بمعدل 81-92%. تكشف هذه النتائج عن تحديات كبيرة تحتاج إلى معالجة لتلبية متطلبات السلامة القابلة للتطبيق.

إن البحث في هذا المجال لا يقتصر فقط على تقديم الحلول، بل يستدعي أيضاً تقييم التحديات المتبقية لفهم فعالية دفاعات النماذج اللغوية المرئية.