تعتبر نماذج استرجاع البيانات المعززة بالمعلومات المتعددة الوسائط (Multimodal Retrieval-Augmented Generation - MRAG) من أحدث الأساليب الموثوقة والفعّالة من حيث التكلفة لتأمين قدرات الذكاء الاصطناعي الحواري بواسطة دمج المعرفة الخارجية. ومع ذلك، تجلب هذه النماذج معها تحديات جديدة، مثل مخاطر تسرب المعلومات الخاصة والهجمات على البيانات.

في دراسة جديدة، تم تقديم أداة هجومية مبتكرة تحمل اسم $\text{immrag}$، وهي إجراء تلقائي لاستخراج البيانات يعمل في بيئات مغلقة ضد MRAG القائم على استرجاع الصور. تدمج كل استفسار صورة في ظل سيطرة المهاجم مع صورة تم استرجاعها مسبقًا من النظام، ما يسهل عملية توجيه الاستفسارات نحو مجالات معينة في فضاء التمثيل.

تختلف هذه الأداة عن الهجمات التقليدية التي تسعى إلى تسرب البيانات عبر استفسارات نصية خبيثة، إذ تدمج $\text{immrag}$ التعليمات الخبيثة داخل صورة مدخلة من قبل المستخدم. تم تقييم فعالية هذه الأداة على ثلاثة سيناريوهات حقيقية، تتضمن مساعد طبي ومستشار مستندات وأداة عامة الاستخدام.

أظهرت التجارب أن $\text{immrag}$ قادرة على إعادة بناء ما يصل إلى 611 صورة أشعة، و566 مسح مستندات، و416 صورة ذات استخدام عام، مما يبرز الحاجة الماسة لتطوير تدابير حماية مصممة خصيصًا لمعالجة البيانات المتعددة الوسائط.