في عالم الذكاء الاصطناعي، يعتبر الدفاع الذاتي أحد أبرز الأساليب المستخدمة لحماية النماذج من الهجمات. يستند هذا النوع من الدفاع إلى قدرة النموذج على تقييم الطلب قبل تقديم الرد، وأحد أقوى التطبيقات المعروفة هو نظام SAGE، الذي يحقق معدل نجاح دفاعي يصل إلى 99%.

ومع ذلك، فقد أظهرت دراسة جديدة أن هذا النظام يمكن اختراقه من خلال دمج نوعين من الهجمات. بينما يفشل كل هجوم بمفرده في التأثير بشكل ملحوظ، إلا أن تركيبهما معًا أدى إلى نتائج مذهلة، حيث وصل تأثيرهما إلى 67% عبر ثلاثة نماذج مفتوحة. الأمر المثير هو أن هذه التأثيرات كانت مستمرة حتى مع نماذج بحجم 70 مليار بارامتر.

لنشر الضوء على هذه العملية، تم تحليل كيف أن الدفاع الذاتي يعتمد على قوة النموذج المستهدف. حيث يعتمد SAGE على تقييم النموذج نفسه لتقدير الهجوم، وتحول طلب ذلك إلى رفض صريح في نسبة تتراوح بين 32% و97%، مما يؤدي إلى تفاوتات مثيرة في قدرة الدفاع.

علاوة على ذلك، يعتمد نوع الهجوم الذي يمكنه البقاء على نوع الدفاع المستخدم. على سبيل المثال، في الأنظمة الدفاعية التحويلية، يحتفظ ترميز الكود بمدى أكبر بكثير من الوصول غير المحمي مقارنة بالبحث عن الحروف.

وكجزء من الدراسة، تم اكتشاف عيب في صلاحية الأداة التي تم استخدامها، حيث لوحظ أن هجومًا معينًا لم يكن له أي منطقة متغيرة، وتم تقديم تشخيص سريع للكشف عن هذا العيب.

هذه الدراسة ليست فقط مجرد تحليل، بل تعتبر دعوة لتعزيز الانتباه نحو ثغرات قد تؤثر على أمان أنظمة الذكاء الاصطناعي.