في عالم الذكاء الاصطناعي المتسارع، تنتقل الوكالات التي تعمل بواجهة المستخدم المدعومة من نموذج اللغة الكبير (LLM) من مجرد نماذج تجريبية إلى تطبيقات واقعية مبكرة. ومع ذلك، فإن هذه الوكالات معرضة بشكل كبير للهجمات البيئية، حيث يمكن للمحتوى غير الموثوق به التأثير على أدائها بشكل غير متوقع.

تتضمن الهجمات البيئية أنواعًا مختلفة، مثل الحقن غير المباشر و التعليمات العدائية، التي يمكن أن تغير تصرفات هذه الوكالات دون علم المستخدم. توفر مجموعة المعايير الحالية في كثير من الأحيان تقييمًا غير كافٍ للسيناريوهات اليومية، مما يتطلب تحسينًا في منهجية التقييم المستخدمة.

لملء هذه الفجوة، تم تقديم معيار جديد باسم MobileWorldSafety، والذي يحتوي على 142 مهمة مخاطر مبنية على تطبيقات أندرويد الحقيقية. يشمل هذا المعيار مؤشرًا مرئيًا قابلًا للتحقق بالنسبة للمخاطر يحدد حالة النظام النهائية لكل مهمة ويمكّن من تقييم النتائج عبر عملية من مرحلتين؛ تتعامل الأولى مع حالات واضحة وفقًا للقواعد، في حين تحكم الثانية فحصًا للغموض من خلال مُصنّف نموذج اللغة الكبير.

تشير التقييمات التي أجريت على ستة وكلاء، بما في ذلك وكلاء عامين ووكلاء متخصصين، إلى أن جميع هؤلاء الوكلاء لا يزالون عرضة بشكل كبير للهجمات، حيث تتراوح نسبة النجاح في الهجمات بين 40.4% و66.9%. هذه النتائج تبرز مدى الفشل في الحفاظ على التوافق الأمان عندما يُقدم محتوى عدائي ضمن السياقات العادية للاستخدام المحمول.

يوفر MobileWorldSafety أساسًا لت quantifying هذه الثغرات ويعزز البحث في تطوير وكلاء واجهة مستخدم متنقلة أكثر أمانًا وموثوقية.