تشهد نماذج اللغات الضخمة (MLLMs) انتشاراً متزايداً في التطبيقات التي تستخدمها الجماهير، ولكنها تحمل مخاطر الأبواب الخلفية (Backdoors) التي تنتج من عمليات بناء هذه النماذج. من المعروف أن وجود مشغلات تحليلية في الصور أو النصوص يُعرض هذه النماذج لشتى أنواع الهجمات. للأسف، الطرق التقليدية لإزالة الأبواب الخلفية، والتي غالبًا ما تُستخدم مع المصنفات التقليدية، أظهرت فعالية محدودة في معالجة MLLMs.
وقد صُمم إطار العمل الجديد RACER خصيصًا لسد هذه الفجوة، حيث يعتمد على ملاحظة رئيسية تدور حول كيفية تأثير الأبواب الخلفية على التطورات غير الطبيعية عبر الطبقات المختلفة للنماذج. هذا ما أطلق عليه اسم "الانحراف الطبقي". كما يُظهر البحث أن هذه الحالة غير الطبيعية تختلف في طبيعتها باختلاف النوع، مما يعني أنها تتركز في مناطق معينة من التمثيلات التي تُشفّر خصائص المشغلات.
من خلال تفكيك التمثيل المدمج إلى مناطق رمزية بصرية ونصية، يعمل RACER على معالجة انحرافات الطبقات بشكل منفصل، مما يسمح بإعادة تركيبها باستخدام أوزان متناسبة حسب النوع. مع اعتماد تقنيات تحسين دقيقة، يتمكن RACER من دفع إصلاح النموذج، وتحسين الأداء بعد الهجوم.
في تجارب شاملة على ثلاث أنظمة MLLMs مفتوحة المصدر، أظهرت النتائج أن RACER استطاع تقليل متوسط نسبة النجاح (ASR) إلى 1.1%، مع تحقيق صفر% في 32 إعدادًا، وذلك مع الحفاظ على الأداء الفعال للنموذج، سواء مع نماذج نظيفة أو متأثرة بالأبواب الخلفية. هذا البحث يفتح آفاق جديدة للأمان في models المعتمدة على الذكاء الاصطناعي، ويحث المطورين على استخدام هذا النوع من الهياكل المسؤولة.
إصلاح موثوق للثغرات في نماذج اللغات الضخمة: كيف يُمكننا صد الأبواب الخلفية بفعالية!
تُعتبر نماذج اللغات الضخمة (MLLMs) عرضة لمخاطر الأبواب الخلفية، ولكن تم تطوير إطار عمل جديد يسمى RACER لإصلاح هذه الثغرات بشكل فعال. يقدم RACER طرقًا مبتكرة لإزالة تلك الأبواب خلفية دون الحاجة إلى معرفة مسبقة عن الهجمات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
