في عالم الذكاء الاصطناعي المتطور، تعتبر الوكالات الذكية التي تعتمد على نماذج اللغة الكبيرة (LLMs) تحسنات مثيرة للغاية، خاصة عند استخدامها في تفاعلات طويلة الأمد. ولكن، بينما تزيد تعقيدات هذه التفاعلات، قد تنشأ مشكلات تتعلق بالسلامة بعد عدة خطوات، مما يجعل تقييم أداء الوكالات على أساس النجاح في المهام أو الهجمات أمرًا مضللاً. في هذا السياق، تم تقديم Blindspot، وهو معيار جديد يهدف إلى قياس السلامة وسلوك الوكالات خلال تفاعلات متعددة المراحل.

Blindspot يقوم بتقييم المسارات الخاصة بالمستخدم والوكيل والبيئة من خلال تفاعلات عدائية متكيفة، وتنفيذ أدوات ذات حالة دائمة، وتحكيم مستند إلى الأداء. يتضمن المعيار حالياً 22 مجموعة هجمية و35 سيناريو موزعة عبر سبعة مجالات، منتجًا أكثر من 2500 مسار تفاعلي طويل بطول متوسط يبلغ 14.7 خطوة.

كل مسار يُصنف وفقًا لإحدى خمس نتائج: إنهاء آمن، رفض صحيح، إنهاء غير آمن، رفض زائد، أو حالة غير محددة. على عكس مجموعات البيانات الثابتة للهجمات، يعد Blindspot إطارًا قابلًا للتطوير يسمح بإضافة الهجمات والسيناريوهات والأدوات والسياسات دون الحاجة إلى إعادة تصميم أنبوب التقييم.

تم تقييم 13 نموذجًا من نماذج اللغة الكبيرة باستخدام ثمانية مقاييس تغطي الانتهاء غير الآمن، الرفض المناسب، الفائدة الحميدة، الرفض المفرط، قوة الأداء عند إعادة التشغيل، وفشل ما بعد الرفض. تشير النتائج الأولية إلى وجود اختلافات كبيرة في معايرة السلامة والفائدة عبر النماذج وتظهر أن الفشل يمكن أن يظهر فقط بعد خطوات تفاعلية آمنة عدة. تحفز هذه النتائج على اعتبار سلامة الوكيل خاصية على مستوى المسار وليس مجرد معيار نجاح ثنائي.

نستطيع القول إن Blindspot يمثل خطوة مهمة نحو تحسين السلامة في التطبيقات الذكية المعقدة، ويؤكد على أهمية الإجراءات المستمرة في تقييم معايير الأداء في الذكاء الاصطناعي.