في زمن تتقدم فيه التكنولوجيا بوتيرة سريعة، تظهر التحديات الجديدة التي تواجه وكالات الذكاء الاصطناعي (AI Agents) في ظل الهجمات متعددة الدور (Multi-Turn Attacks). حيث يمكن أن تجمع هذه الهجمات بين أفعال فردية مسموح بها لتنتج نتائج ضارة، مما يجعل الدفاعات التقليدية غير فعالة التي تقيم الإجراءات أو الحالات بصورة منعزلة دون الأخذ بالاعتبار السياقات المتعددة.

أظهرت دراسات حديثة أن هذه الهجمات تترك بصمات واضحة في تمثيلات الوكيل الداخلية (Internal Representations)؛ حيث ينشأ سلوك ضار نتيجة تحول متراكم في التمثيل عبر تحديثات السياق، التي يمكن تحديدها بنفس الإشارة. هذا الأمر يتطلب تقنيات متقدمة لفهم وعزل التغيرات في التمثيل، إذ أن جمع المعلومات بصورة بدائية قد يؤدي إلى الإصابة بحالات غير ضارة.

تم تقديم إطار عمل متقدم يُعرف بـ DART، والذي يركز على الكشف عن التحولات في التمثيل. هذا الإطار لا يساعد فقط في تحديد مسبب النشاط الضار، بل يتضمن أيضاً تذكيرات مستهدفة للحد من الأضرار. تم اختبار DART عبر ستة نماذج واثنين من المعايير متعددة الدور، حيث انخفضت نسبة نجاح الهجمات من 84% إلى 25%، مع معدل إنذار كاذب متوسط يبلغ 12%.

وبالمقارنة مع ToolShield، الدفاع الرائد في هذا المجال، أظهرت DART أداءً متفوقاً حيث حققت نتائج أفضل عبر جميع النماذج الستة. في حين كان أداء ToolShield يقتصر على 55%. ولقد أظهرت الدراسة أن عملية إزالة الضوضاء في التحولات كانت حاسمة، حيث لم يحقق المراقب غير المعدل سوى 7%-40% من كشف الهجمات، بينما تم تعديل المراقب ليحقق ما بين 60%-85%.

كما تم تصميم DART ليكون خفيف الوزن، حيث يضيف فقط 0.14-0.56 ثانية كعبء إضافي لكل خطوة مراقبة، مما يجعله مكملاً فعالاً للدفاعات الثقيلة.

إن الابتكارات في هذا المجال ليست مجرد خطوات تقنية، بل تمثل مزيجاً من الإبداع والاستجابة المعقدة للتحديات التي تواجه الذكاء الاصطناعي اليوم.