تُعد نماذج Guardrail واحدة من الحلول المهمة المستخدمة في تصنيف وفحص المحتوى الخبيث في خدمات الذكاء الاصطناعي المعتمدة على نماذج اللغات الضخمة (Large Language Models). ومع تزايد متطلبات الأداء، تعتمد هذه النماذج على هياكل Transformer المُصغرة، مثل DeBERTa، والتي تُدرّب على نوافذ سياقية قصيرة لا تتجاوز 512 توكن.

ولكن ماذا يحدث عندما تكون فرضية استقرار قرارات هذه النماذج مُعرضة للخطر؟!

في دراسة جديدة، تم التعرف على ظاهرة تُدعى Overflip، حيث يؤدي تكرار المدخلات إلى قلب توقعات الحماية من النتائج الخبيثة (MAL) إلى النتائج المحمية (BEN) بينما تتزايد طول السلسلة.

قامت التجارب على تسعة نماذج Guardrail خفيفة، أظهرت خمسة منها مشاكل كبيرة، حيث تراوحت نسب انزلاق التوقعات من 8% إلى 92%! ومن المثير للاهتمام أن هذا الأمر يحدث بعد حوالي 2600 إلى 9400 توكن من التكرار.

ما يميز Overflip هو أنه يحتفظ بالمحتوى الخبيث بدلاً من تحويل النموذج بعيدًا عنه كما تفعل طرق تقليل الانتباه التقليدية. ومع الاحتفاظ بسلامة المدخلات، يبقى المعنى الفعلي موجوداً، مما قد يؤدي إلى تمرير نيات خبيثة على الرغم من مرورها عبر نماذج الحماية.

تسلط هذه النتائج الضوء على الحاجة الملحة لتحسين الأساليب المستخدمة في تقييم نماذج الحماية والكشف عن أي ثغرات محتملة للتصدي للهجمات الإرهابية. في عالم الذكاء الاصطناعي سريع التطور، تأتي هذه التحذيرات كدعوة إلزامية للمطورين والمختصين لتعزيز أمان أنظمتهم من خلال تحسين البحث والتطوير في هذا المجال.