شهدت نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) تطورًا هائلًا في السنوات الأخيرة، حيث زادت من قدرتها على معالجة المعلومات من خلال دمج البيانات النصية والصورية. ولكن، بينما تكشف هذه النماذج عن إمكانيات غير محدودة، فإنها تطرح أيضًا مخاوف جديدة فيما يتعلق بالسلامة، خاصةً في ما يتعلق بظاهرة "تحول السلامة بين الأنماط".

تحول السلامة بين الأنماط يحدث عندما يبدو أن استفسار نصي غير ضار يمكن أن ينقل نية ضارة عندما يتم تجسيده بصورة معينة. وقد أظهرت الدراسات الأولية أن معدل الاستجابة للسلامة لهذا النوع من الطلبات أقل بكثير مقارنةً بالطلبات التي تحتوي على نصوص غير آمنة بشكل صريح.

في ورقة بحثية حديثة، تم إجراء تحليل تجريبي لتحديد أنماط الاستجابة غير الآمنة. ومن خلال تفسير تمثيلات النموذج والتركيز، اتضح أن الإشارات البصرية المحفوفة بالمخاطر تحصل على اهتمام محدود مما يؤدي إلى ردود فعل ضعيفة تجاه الرفض.

لتجاوز هذه المشكلة، قدم الباحثون أسلوبًا جديدًا يُعرف باسم "نقل تمثيل الوعي بالسلامة" (Safety-Awareness Representation Transfer - SRT). يعتمد هذا الأسلوب على تحسين التوجيهات في نموذج لغة كبيرة ثابت (frozen MLLM) للحد من تحول السلامة بين الأنماط. أثبتت التجارب عبر مجموعة متنوعة من النماذج ومعايير الأداء أن طريقة SRT تُحسن الأمان في البيئات متعددة الوسائط دون التأثير على الفعالية.

يمكنك الاطلاع على الكود الخاص بهذه الدراسة عبر الرابط: GitHub.

ما رأيكم في هذا التقدم؟ هل تعتقدون أن هذه الأساليب ستكون فعالة في تعزيز الأمان في الذكاء الاصطناعي؟ شاركونا في التعليقات.