في عالم الذكاء الاصطناعي، حيث تتفاعل الوكالات المبنية على نماذج اللغات الضخمة (Large Language Models) مع بيئات خارجية عبر استدعاء الأدوات، تظهر الحاجة الملحة لاتخاذ تدابير أمان فعالة. أطلق الباحثون نموذج StepGuard، الذي يمثل قفزة نوعية في تعزيز الحماية ضد المخاطر الأمنية التي قد تنتج عن استخدام هذه الوكالات.

تمكن هذا النموذج من إجراء تدقيق دقيق لخطوات الوكالات، مما يسمح له بالتحقق من أفعال الأدوات قبل تنفيذها. وهو يتجاوز الطرق التقليدية التي تقيم فقط نتائج مسارات الانتهاء، مما يجعله أكثر فاعلية في رصد التجاوزات في الوقت الحقيقي.

لتحقيق ذلك، تم تقديم نظام StepGen لتوليد بيانات تلقائية، والذي ينتج مسارات آمنة وغير آمنة في سياق موحد مع استخدام إجراءات مختلفة في الخطوات ذات المخاطر. وبمساعدة نهج Balance-GRPO، يصبح من الممكن تحقيق توازن ديناميكي بين الأفعال الآمنة وغير الآمنة استنادًا إلى دقتها الملحوظة. أظهرت التجارب أن StepGuard يشهد أفضل دقة متوسطة بين نماذج الحراسة، حيث تتقارب أداؤه مع GPT-5.4.

عند تطبيقه على أنظمة مثل AgentDojo وAgentDyn، تمكن StepGuard من تقليل معدل نجاح الهجمات بمعدل 77.3% مقارنة بالأنظمة غير المحمية، بينما انخفض الاستخدام فقط بمقدار 2.8 نقطة مئوية.

إن هذه الابتكارات تفتح الأبواب نحو مستقبل أكثر أمانًا للذكاء الاصطناعي، فما رأيكم في هذا التطور المذهل؟ شاركونا في التعليقات!