في عصر يتزايد فيه الاعتماد على نماذج الذكاء الاصطناعي متعددة النماذج (Multimodal Large Language Models - MLLMs) في التطبيقات الحياتية، برزت مخاوف بشأن سلوك هذه النماذج عند تنفيذ التعليمات. أظهرت الدراسات أن نماذج الذكاء الاصطناعي قد تكون عرضة لهجمات اختراق التعليمات (Prompt Injection Attacks).

في البحث الجديد، استعرض الباحثون وسيلة جديدة للهجمات غير المرئية حيث يتم إدخال تعليمات ضارة في الموديل بطريقة تجعل من الصعب على البشر اكتشافها. يتم ذلك من خلال تضمين التعليمات الخبيثة في المدخلات البصرية عبر تغطية نصية محدودة، مما يعطي توجيهًا دلاليًا.

تم تحسين الإزعاج المرئي بشكل دوري، بحيث يتماشى التصور البصري لمدخل الصورة المستهدفة مع الأهداف البصرية والنصية الخبيثة على مستويات دقيقة وخشنة. يتمثل الهدف البصري في صورة تم إنشاؤها من نص وتتم معالجتها بشكل تدريجي خلال عملية التحسين، مما يجعلها تعكس المعاني المطلوبة بشكل أكثر دقة.

عبر مجموعة من التجارب على مهام الفهم المتعددة النماذج، أثبتت الطريقة الجديدة تفوقها مقارنةً بالأساليب الحالية، مما يشير إلى أنها قد تقدم وسيلة أكثر فاعلية للتهديدات الأمنية.

هذا البحث يمثل تحذيرًا مهمًا يجسد ضرورة تعزيز الأمان في نظم الذكاء الاصطناعي متعددة النماذج، نظرًا لأنها تستخدم بشكل متزايد في مجالات حيوية مختلفة.

ما رأيكم في هذا التطور؟ هل تعتقدون أن علينا قلق بشأن أمان هذه الأنظمة؟ شاركونا في التعليقات.