في عالم الذكاء الاصطناعي، تُعتبر مهارات الوكلاء (Agent Skills) عبارة عن أشكال قابلة للمشاركة من التعليمات الإجرائية والأدوات والأمثلة. لكن ماذا يحدث عندما تُدمج هذه المهارات مع العناصر المرئية؟ هذه هي النقطة التي تظهر فيها تقنية جديدة تُدعى MMSkillRisk، والتي يمكن أن تُحدث تحولًا جذريًا في كيفية تقييم سلامة المهارات متعددة الأبعاد.

تتضمن المهارات متعددة الأبعاد عناصر بصرية تساعد الوكلاء أثناء تنفيذ المهام. ولكن يمكن اختباء التعليمات الضارة تحت ستار التوجيهات البصرية الشرعية، مما يفتح الباب أمام تهديدات جديدة. لذا، تأخذ MMSkillRisk على عاتقها مسؤولية توفير أول معيار عام متاح لتقييم سلامة الهجمات القائمة على الصور أثناء تنفيذ المهارات.

تم تصميم تقنية جديدة تُعرف باسم Native-Context Visual Attack (NCVA)، حيث تقوم بتمويه التعليمات الضارة كجزء من التعليمات المرئية. ولضمان فعالية هذا النوع من الهجوم، قامت MMSkillRisk بجمع 36 حزمة هجوم و108 حالة قابلة للتنفيذ. المفاجأة الأكبر كانت في نتائج البحث، حيث أظهرت الدراسات أن معدل نجاح الهجمات يصل إلى 43.1%، مما يسلط الضوء على ضرورة عدم الاعتماد فقط على نجاح المهام لتأكيد سلامة استخدام المهارات.

تضع هذه الدراسة القواعد الأساسية لتحسين سلامة الذكاء الاصطناعي من خلال تقييم شامل لأساليب الهجوم التي تعتمد على العناصر المرئية. وللأشخاص المهتمين بالتعمق في هذا المجال، يمكنكم العثور على كل المعلومات والبيانات على رابط Github الخاص بالمشروع. هل تعتقد أن هذه الابتكارات الجديدة ستغير طريقة تقييم السلامة في الذكاء الاصطناعي؟ شاركونا آراءكم.