في عالم الذكاء الاصطناعي، تعتبر نماذج الحراسة (Safety Guards) أدوات حيوية تصفي المحتوى الضار، لكن ما إذا كانت هذه الأنظمة تعمل بكفاءة هو سؤال مهم.

أظهرت دراسة جديدة أجريت على مجموعتين من البيانات التدريبية، WildGuardMix وGR-Train، أن تعبيرات الرفض (Refusal Expressions) تتواجد عمومًا مع تصنيفات غير ضارة. هذا الخلل يُعزز من ظهور كود الإخفاق الحذري (Refusal-Cue Shortcut)، والذي يعني أنه عند تضمين كود للرفض في ردود سفليّة ضارة، يمكن أن تتبدل النتيجة من "ضار" إلى "غير ضار".

لقد أثّر هذا على نماذج الحراسة التي تم تدريبها باستخدام هذه المجموعات، وكذلك النماذج الرسمية مثل LlamaGuard3 وQwen3Guard.

لحل هذه المشكلة، اقترح الباحثون استخدام تقنية التمويه المكمل النادرة (Sparse Complementary Masking) كإجراء خفيف لتعزيز الأداء، مما يساعد على التعرف على أعطال الاستجابة التي تثيرها أكواد الرفض، مع الحفاظ على أداء الكشف القياسي. وقد حققت هذه التدخلات تحسينات تقدر بنسبة 79% في تقليل الفشل في الكشف عن المحتوى الضار بسبب الأكواد السلبية.

الإجراءات لم تكن مجدية فقط في حالات معينة، بل أظهرت تأثيراتها انتقالًا إلى مواقع ومجموعات بيانات غير متوقعة، مما يشير إلى أن الإخفاقات يمكن أن تكون متعلقة بمكونات داخلية مشتركة.

هذا البحث يبدو مثيرًا جدًا حيث يفتح الباب لإمكانيات جديدة في تعزيز كيفية تعامل أنظمة الذكاء الاصطناعي مع المحتوى الضار، مما يعزز كفاءة وأمان الاستخدام.