لقد أصبحت الوكلاء طويل الأمد (Long-horizon Agents) تلعب دورًا محوريًا في مساعدة البشر على حل المشكلات المعقدة. ومع ذلك، فإنه precisamente **تاريخ التفاعل الممتد** هو ما يثير قلقًا تجاه السلامة وقد يؤدي إلى مخاطر تجاهل قيود السلامة السابقة. نعبر عن هذا القلق بمصطلح "خطر التنظيم الناتج عن تجاهل قيود السلامة عبر الأدوار" (GHOST)، والذي يمكن أن يتسبب في أضرار غير قابلة للإصلاح.
أظهرت التجارب أن أحداث GHOST ليست حالات معزولة، بل إنها تحدث بنسبة 11.5% عند البيانات المستخدمة من موديل GPT-5.5 في ظل ظروف تفاعل تبدو غير ضارة. لقد تم اكتشاف أن أي انتهاك متبقي لقيود السلامة قد ينتهي بإدخال الوكيل إلى منطقة الخطر تقريبًا بشكل مؤكد.
من خلال الاستفادة من هذه الرؤى النظرية، قمنا أيضًا بتقديم نظام حماية جديد يُطلق عليه STAR-Guard، الذي يجمع بين استعادة قيود السلامة الدلالية التاريخية والتدقيق القبلي. يعمل STAR-Guard على استعادة قيود السلامة المناسبة لتقليل الاقتراحات غير الآمنة، بينما تمنع طبقة التدقيق المحددة الانتهاكات المتبقية من الوصول إلى البيئة. وبتطبيق هذا التصميم ذو الطبقتين، لم نلاحظ أي أحداث GHOST في تجاربنا باستخدام إعداد GPT-5.5.
خطر التنظيم في الوكلاء طويل الأمد: كشف النقاب عن التهديدات الخفية للسلامة
تقديم مفهوم GHOST، وهو مخاطر التنظيم الناجمة عن تجاهل قيود السلامة القديمة في الوكلاء طويل الأمد. تكشف التجارب أن هذه المخاطر قد تحدث بنسبة 11.5% عند استخدام نماذج مثل GPT-5.5.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
