تتزايد الصعوبات أمام نماذج اللغة الآمنة المستندة إلى الذكاء الاصطناعي، خصوصًا عند استخدامها كمساعدين في الحوارات المتعددة الأدوار. حيث تسمح هذه الحوارات للمهاجمين بنشر نوايا غير آمنة عبر محادثات طويلة، بدلاً من تحفيزها من خلال أمر واحد فقط. لهذا الغرض، تم تطوير نماذج كشف الانحدار مثل GradSafe، التي تستخدم لتعزيز الأمان عبر تقييم المدخلات بناءً على الارتباط بين انحدارها واتجاه غير آمن ثابت. لكن فعالية هذه النماذج في الحوارات المتعددة الأدوار لم يُتبيّن بعد.

في إطار هذا البحث، أجرينا تقييمًا محكمًا لكشف jailbreak القائم على الانحدار في إعدادات حوار متعددة الأدوار. قمنا بتوسيع نموذج GradSafe ليشمل ماسح نافذة السياق (Context Window Scanner) الذي يطبق النموذج على نوافذ ثابتة الحجم من تفاعلات المستخدم، ويستخدم أعلى نتيجة من هذه النوافذ كمقياس لمستوى الحوار.

تمت تجربة أحجام نوافذ مختلفة، وعائلات هجمات متنوعة، وتوزيعات محادثات غير ضارة، ونماذج مستهدفة. والناتج أظهر اختلافات حادة بين الإعدادات الاصطناعية والواقعية. في ظل المحادثات الاصطناعية، حقق النموذج نسبة ROC-AUC تبلغ 0.98 عند تقييم jailbreakات متعددة الأدوار. ومع ذلك، انخفضت النسبة إلى 0.76 مع المحادثات الواقعية على منصة WildChat، مما أدى إلى تمييز أكثر من 90% من المحادثات غير الضارة كغير آمنة نتيجة لاختبار على بيانات اصطناعية.

كما أظهر النموذج حساسية تجاه طريقة توليد الهجوم والنموذج المستهدف: فالهجمات الناجحة من عائلة Crescendo حصلت على درجات مشابهة أو أقل من المحادثات غير الضارة، ونموذج Qwen2.5-7B-Instruct أسفر عن فاصل تقريبي عشوائي مع حجم نافذة مثالي مختلف. تبين هذه النتائج أن الإشارات القائمة على الانحدار يمكن أن تدعم الكشف عن jailbreak في الحوارات المتعددة الأدوار، لكن نشرها بشكل موثوق يتطلب معايرة على المحادثات غير الضارة الحقيقية، وتقييم عبر جميع أنواع الهجمات وهياكل النماذج.