في ظل التقدم السريع للذكاء الاصطناعي، تتجلى تحديات جديدة في كيفية تعاطي نماذج الذكاء الاصطناعي مع التحذيرات والاختراقات. واحدة من تلك التحديات هي اختراقات تحويل الصورة إلى نص (Image-to-Text Jailbreaks)، والتي تتضمن تضمين نوايا ضارة في النصوص مستندة إلى cualité الصورة.

تتناول دراسة جديدة نشرت في arXiv والتي تضمنت تحليلًا لأربعة عائلات من الهجمات عبر 313 مثالا في نموذج StrongREJECT. وقد اختبرت الدراسة خمسة نماذج متعددة الوسائط مع إضافة تقييم خاص لنموذج InternVL3.5-8B.

تشير النتائج إلى أن التعليمات الضارة كانت ثابتة عبر مختلف الظروف المحيطة بالدراسة. وقد أظهرت البيانات أن استجابات النصوص كانت ضعيفة في تحقيق النجاح عند استخدام استفسارات ضارة، إلا أن تعزيزها بخيارات صور معينة أدى إلى زيادة ملحوظة في نجاح الهجمات.

تتضمن الدراسة تحليلاً للخصائص مثل Entropy لكل بلاطة وحجم JPEG. ورغم أن هذه الخصائص لم تكن كافية لتحديد البلاطات الهجومية عن نظيراتها المسالمة، إلا أن وجود العوامل المرئية كان له تأثير على الاختراقات. قدمت الدراسة أيضًا اختبارات مختلفة بقيت قائمة بعد التصحيح الإحصائي العالمي، مؤكدة على عدم وضوح العلاقة بين عدد البلاطات والبنية ذات الصلة.

من المتوقع أن تثير هذه النتائج نقاشات مهمة حول كيفية التعامل مع هذه التحديات من قبل مطوري البرمجيات والباحثين في مجال الذكاء الاصطناعي.

كيف تعتقد أن اختراقات تحويل الصورة إلى نص ستؤثر على مستقبل الذكاء الاصطناعي؟ شارك برأيك في التعليقات.