في عالم الذكاء الاصطناعي، تظل نماذج الرؤية واللغة الكبيرة (Large Vision-Language Models - LVLMs) عرضة لهجمات تحطيم الأمان، حيث يمكن استخدام المدخلات البصرية للتغلب على ضوابط السلامة المستمدة من البنية اللغوية لهذه النماذج. ولكن، هل هناك حل مبتكر لهذه المشكلة؟

نقدم لكم SafeCap، إطار عمل يعتمد على التعلم المعزز يهدف إلى تحسين أمان هذه النماذج. يعمل SafeCap من خلال تعزيز عملية توليد التوصيفات الذاتية المتعلقة بالسلامة، ما يمكن النموذج من إنشاء وصف للصورة أولاً، ثم producing إجابة نهائية. هذه العملية تتيح تحسين وصف الصورة بناءً على مدى قدرة نموذج اللغة الثابت (Frozen LLM) على الوصول إلى قرار متوافق مع معايير السلامة.

تُظهر النتائج أن SafeCap يُحسن الأداء العام في السلامة عبر خمسة معايير سلامة متعددة الوسائط وموارد مفيدة للرؤية، حيث سجلت النماذج التي استخدمت SafeCap تحسينات تتراوح من 3.7 إلى 19.0 نقطة في متوسط السلامة، مع الحفاظ على كفاءة أداء البصريات أو حتى تحسينها.

تحت مقارنة محكومة مع نماذج متطابقة من حيث البنية والبيانات، أظهر SafeCap تفوقًا على نماذج أمان أخرى مثل SFT وDPO وSafeGRPO، مؤكدًا فعالية التعلم المعزز المدعوم بالتوصيفات في تحقيق ترتيب السلامة المتعددة الوسائط.