في عالم تكنولوجيا المعلومات المتطور، تبرز الحاجة إلى معايير فعّالة لتقييم المخاطر الأمنية، خصوصًا تلك المتعلقة بوكالات العمل المدعومة بنماذج لغوية ضخمة (Large Language Models). في هذا السياق، تم إطلاق EvoRiskBench، وهو معيار متطور مصمم لضمان أمان التطبيقات والعمليات المتعددة الخطوات.

يستند EvoRiskBench إلى إطار EP-Path-EF الذي يربط بين نقاط دخول المخاطر الأولية والتأثيرات التقنية من خلال مسارات المخاطر المدعومة بالوكالات. ويتميز هذا الإطار بتحديد تسع فئات لنقاط الدخول وخمس فئات للتأثيرات، حيث أجريت دراسة شملت عشرين مشاركًا لدعم قابلية تفسير النتائج وتناسق التصنيف في الحالات الممثلة.

هذا المعيار يتيح تكوينًا آليًا لعمل شامل، حيث يقوم بإنشاء وتنفيذ حالات المخاطر في بيئات معزولة والتحقق من النتائج بشكل مستقل باستخدام سجلات التنفيذ وحالات البيئة. وبذلك، يقدم EvoRiskBench مجموعة بيانات قابلة للتكرار تتضمن 450 مهمة عدائية عبر ستة سيناريوهات.

كما تم تقييم تسع تكوينات من نماذج مختلفة، شملت GPT-5.6 Sol، DeepSeek-V4-Pro-0813، وClaude Opus 5، بالإضافة إلى ثلاثة أدوات أو مكونات (Harnesses) هي Claude Code، Codex، وOpenClaw. وتظهر النتائج وجود ثغرات كبيرة عبر الأنظمة، إذ يصل معدل نجاح الهجمات إلى 68.44% في أكثر التكوينات ضعفًا، مما يشير إلى أن تكوين وكالات العمل غير كافٍ لضمان تنفيذ آمن.

تتفاوت إعدادات معدل نجاح الهجمات (ASR) عبر النماذج أكثر من اختلافات الأدوات، وتعتمد اختلافات الأدوات على النموذج المستخدم. سيتم إصدار حالات المعيار ومنصة التقييم بعد الانتهاء من التحقق من سلامة المعدات وقابلية التكرار.