لقد أصبحت الوكلاء طويل الأمد (Long-horizon Agents) تلعب دورًا محوريًا في مساعدة البشر على حل المشكلات المعقدة. ومع ذلك، فإنه precisamente **تاريخ التفاعل الممتد** هو ما يثير قلقًا تجاه السلامة وقد يؤدي إلى مخاطر تجاهل قيود السلامة السابقة. نعبر عن هذا القلق بمصطلح "خطر التنظيم الناتج عن تجاهل قيود السلامة عبر الأدوار" (GHOST)، والذي يمكن أن يتسبب في أضرار غير قابلة للإصلاح.

أظهرت التجارب أن أحداث GHOST ليست حالات معزولة، بل إنها تحدث بنسبة 11.5% عند البيانات المستخدمة من موديل GPT-5.5 في ظل ظروف تفاعل تبدو غير ضارة. لقد تم اكتشاف أن أي انتهاك متبقي لقيود السلامة قد ينتهي بإدخال الوكيل إلى منطقة الخطر تقريبًا بشكل مؤكد.

من خلال الاستفادة من هذه الرؤى النظرية، قمنا أيضًا بتقديم نظام حماية جديد يُطلق عليه STAR-Guard، الذي يجمع بين استعادة قيود السلامة الدلالية التاريخية والتدقيق القبلي. يعمل STAR-Guard على استعادة قيود السلامة المناسبة لتقليل الاقتراحات غير الآمنة، بينما تمنع طبقة التدقيق المحددة الانتهاكات المتبقية من الوصول إلى البيئة. وبتطبيق هذا التصميم ذو الطبقتين، لم نلاحظ أي أحداث GHOST في تجاربنا باستخدام إعداد GPT-5.5.