في عالم الذكاء الاصطناعي، تعتبر نماذج الحراسة (Guard Models) عنصراً حيوياً لضمان سلامة العمليات والقرارات المتعلقة بالتحكم في التدفق. ومع ذلك، تكشف دراسة جديدة عن وجود مشكلة خطيرة تتمثل في ثقة هذه النماذج الزائدة، خاصة عند مواجهة بيانات هجومية.

تستند هذه الدراسة إلى تقييم خمسة نماذج حراسة مخصصة لتصنيف الطلبات، وقد أظهرت النتائج أن العديد من هذه النماذج تعتمد على تقنيات تضمّن توافقًا جيدًا مع المدخلات النقية، ولكن عندما تتعرض لهجمات مضادة، تتدهور دقتها بشكل كبير. يتحول بالتالي الفشل في تعرف العناصر إلى أخطاء عالية الثقة غير قابلة للتفريق عن الاكتشافات الصحيحة.

عند المقارنة مع نماذج الأساس (Base Models)، وجدت الدراسة أن إشارات عدم اليقين لا تزال متاحة، حيث تظهر نماذج الأساس عادة عدم اليقين في نفس المدخلات التي تفشل بها نماذج الحراسة. ومن خلال التحليل الطبقي، تم تحديد أن الفجوة بين نماذج الحراسة ونماذج الأساس تظهر بوضوح في الطبقات اللاحقة، حيث تتمتع نماذج الحراسة بفصل أكثر حدة بين الفئات الآمنة وغير الآمنة بينما تقترب المدخلات الضارة من المنطقة الآمنة.

تشير هذه findings إلى عدم توافق بين ثقة نماذج الحراسة وعدم اليقين في نماذج الأساس حينما تتعرض لهجمات، مما يستدعي الحاجة لتطوير نماذج حراسة أكثر دقة وثقة. مع استمرار التطور في مجموعة أدوات الذكاء الاصطناعي، يمثل ذلك دعوة للأساتذة والباحثين لتعديل الأساليب الحالية وتعزيز التفاعل بين الثقة وعدم اليقين.

ما رأيكم في هذه التطورات؟ هل تعتقدون أن الوقت قد حان لإعادة النظر في كيفية تدريب نماذج الحراسة؟ شاركونا في التعليقات!