في خضم التطور السريع للذكاء الاصطناعي، تظهر مخاطر جديدة تتعلق بنماذج الرؤية واللغة (Vision-Language Models)، وخصوصًا تلك التي يمكن استغلالها بشكل غير مشروع. إحدى الدراسات الحديثة، التي تم نشرها في arXiv، تقدم تحليلاً شاملاً لآليات الدفاع في الوقت الحقيقي ضد محاولات الهروب (Jailbreaks) من هذه النماذج.

تقدم الدراسة مقارنة بين خمس استراتيجيات دفاعية عبر 15 خلية نموذجية من أربع عائلات معمارية مختلفة، باستخدام بروتوكول يتحكم في حجم التدخل لكل حالة. تشمل الاستراتيجيات المقارنة:
1. التحول الشرطي للصور (Mean Image Conditioning Shift)
2. اتجاه الرفض بنمط CMRM
3. الاتجاه الخاص بالهجمات في نموذج ShiftDC
4. تعليمات تجاهل الصورة.
5. تحكم عشوائي.

لم يُظهر أي من المرشحين تفوقًا واضحًا على كلا الجانبين: استعادة الرفض والحفاظ على الفائدة. ومع ذلك، حقق تحول الصور الشرطي نتائج متميزة خاصة على نموذج LLaVA 1.5 وPixtral 12B، حيث كانت الخسائر في الفائدة عند أدنى مستوياتها. بينما كان التعليم في التعليمات يحتل الصدارة على نموذج Qwen2.5 VL، وكان الاتجاه الخاص بالهجمات متفوقًا على Qwen2 VL 2B.

تظهر النتائج أن الدفاعات المعتمدة على الاتجاه تتطلب معايير محددة لكل عائلة من عائلات النماذج اللغوية. وبالإضافة إلى ذلك، وجد أن اتجاه CMRM يظهر توافقًا إيجابيًا مع تحول الصور الشرطي في جميع الخلايا البالغ عددها 15 خلية، مما يعكس بوضوح أهمية هذه الأبحاث في تعزيز الأمان في نماذج الذكاء الاصطناعي.

ما رأيكم في هذه التطورات المثيرة؟ هل تعتقدون أن هذه الدفاعات ستكون كافية لحماية نماذج الذكاء الاصطناعي المستقبلية؟ شاركونا آرائكم في التعليقات!