في عصر يتزايد فيه الاعتماد على نماذج الذكاء الاصطناعي متعددة النماذج (Multimodal Large Language Models - MLLMs) في التطبيقات الحياتية، برزت مخاوف بشأن سلوك هذه النماذج عند تنفيذ التعليمات. أظهرت الدراسات أن نماذج الذكاء الاصطناعي قد تكون عرضة لهجمات اختراق التعليمات (Prompt Injection Attacks).
في البحث الجديد، استعرض الباحثون وسيلة جديدة للهجمات غير المرئية حيث يتم إدخال تعليمات ضارة في الموديل بطريقة تجعل من الصعب على البشر اكتشافها. يتم ذلك من خلال تضمين التعليمات الخبيثة في المدخلات البصرية عبر تغطية نصية محدودة، مما يعطي توجيهًا دلاليًا.
تم تحسين الإزعاج المرئي بشكل دوري، بحيث يتماشى التصور البصري لمدخل الصورة المستهدفة مع الأهداف البصرية والنصية الخبيثة على مستويات دقيقة وخشنة. يتمثل الهدف البصري في صورة تم إنشاؤها من نص وتتم معالجتها بشكل تدريجي خلال عملية التحسين، مما يجعلها تعكس المعاني المطلوبة بشكل أكثر دقة.
عبر مجموعة من التجارب على مهام الفهم المتعددة النماذج، أثبتت الطريقة الجديدة تفوقها مقارنةً بالأساليب الحالية، مما يشير إلى أنها قد تقدم وسيلة أكثر فاعلية للتهديدات الأمنية.
هذا البحث يمثل تحذيرًا مهمًا يجسد ضرورة تعزيز الأمان في نظم الذكاء الاصطناعي متعددة النماذج، نظرًا لأنها تستخدم بشكل متزايد في مجالات حيوية مختلفة.
ما رأيكم في هذا التطور؟ هل تعتقدون أن علينا قلق بشأن أمان هذه الأنظمة؟ شاركونا في التعليقات.
هجوم غير مرئي: كيف يمكن لمهاجمين توجيه نماذج الذكاء الاصطناعي بطرق غير مرئية
يستكشف الباحثون كيف يمكن استخدام هجمات جديدة ضد نماذج الذكاء الاصطناعي متعددة النماذج، مما يسمح للمهاجمين بتوجيه التعليمات بطريقة غير مرئية تعمل على خداع الأنظمة. هذه الخطوة تكشف عن ثغرات قد تكون خطيرة في استخدام هذه التقنيات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
