في عالم الذكاء الاصطناعي، تُعتبر الوكالات السايبرية التي تعتمد على نماذج اللغات الضخمة (Large Language Models) محورية في إنجاز مهام معقدة ضد التهديدات السيبرانية. ومع ذلك، تكشف دراسة جديدة عن هشاشة وكالات السايبر في تحقيق أهدافها بسبب شروط غير ملائمة واستراتيجيات تحتاج إلى تحسين.

تتطرق هذه الدراسة التي نُشرت على منصة arXiv إلى نظام "الخصم المستقل"، حيث يعتمد على ثلاثة مستويات: منظم (Orchestrator)، منفذ (Executor)، ومحقق (Validator) في سيناريوهات محاولة الحركة الجانبية في بيئات مشابهة للشركات. تم تقييم ست نماذج متطورة عبر سيناريوهين وثلاثة أوضاع مختلفة - المعرفة الخبرية (Expert-defined)، التهذيب الذاتي (Self-scaffolded)، والاستقلالية الكاملة (Fully autonomous).

لقد وجدت الدراسة أن معدلات النجاح لوحدها لا تعكس الكفاءة الحقيقية. على العكس، تشير الأرقام إلى وجود عوائق وتكاليف خفية نتيجة الاستخدام غير الأمثل للموارد وكيفية تفسير النتائج. تم تقديم دراسة تشخيصية شاملة، تتناول عدم التناسق والتأييد للأدلة، مع إدخال درجة شرطية تحسب التكلفة لاستخدام الرموز غير الطبيعية والمحاولات المتكررة.

من خلال استخدام تحليل "نموذج اللغات كقاضي" (LLM-as-a-Judge)، تم تحديد أوجه القصور في التخطيط التي تشمل عدم توافق الأدوات، وتشابه الخطط، والمواصفات الزائدة، ونقص الاستفسارات، وضعف الاستبقاء. كما أظهرت النتائج أن المحققين، رغم أنهم ذوي صلة وجميعهم مستندون إلى الأدلة، يميلون في الكثير من الأحيان إلى التفاؤل المفرط.

نقاط الاختناق تتجمع في مهام الاعتماد والحركة الجانبية، وتأخذ في الازدياد مع تعقيد السيناريو، وتتنوع أكثر في ظل الاستقلالية الكاملة. ولذا يصبح التقييم الدقيق أمرًا ضروريًا لفهم النتائج وتفسير الأدلة واستخدام الموارد وتكيف الوكالات بعد الفشل. ما رأيكم في هذه النتائج؟ شاركونا رأيكم في التعليقات!