في عصر الذكاء الاصطناعي، أصبحت نماذج اللغات الضخمة (Large Language Models) جزءاً أساسياً من العديد من التطبيقات. لكنها ليست محصنة ضد الهجمات، مثل هجمات الأبواب الخلفية (Backdoor Attacks) التي تكمن في شيفرات خفية تؤدي إلى نتائج ضارة. هذه الثغرات تطرح تحديات كبيرة في مجال الأمان، حيث اعتمدت الحلول التقليدية على آليتين رئيسيتين: الكشف في وقت الاستدلال (Inference Time) والتخفيف في وقت التدريب (Training Time). ومع ذلك، كان هناك الكثير من القيود على فعالية هذه الحلول.

تقدم تقنية DeCNIP (Defense with Critical Neuron Isolation Pruning) حلاً مبتكراً للقضية. هذه التقنية تتجاوز النماذج الأساسية المستخدمة في الكشف وتستند إلى تحليل تمثيلي عميق، حيث تهدف إلى تحديد السلوكيات الشبيهة بالمحفزات (Triggers) والتخلص منها.

تحدد DeCNIP البوابات الخطرة عبر تحسين دالة خسارة الانتروبيا المشتركة (Cross-Entropy Loss) بين المدخلات الضارة والمدخلات الطبيعية، مما يكشف عن التهديدات المخفية. من خلال عزل الأعصاب الحرجة (Backdoor Critical Neurons) والقضاء عليها بشكل انتقائي، تتمكن DeCNIP من إزالة التأثيرات الضارة مع الحفاظ على كفاءة النموذج.

أثبتت التجارب التي أجريت على ستة نماذج مفتوحة المصدر من نماذج اللغات الضخمة وعبر مجموعتين مختلفتين من البيانات أن DeCNIP حققت أكثر من 95% انخفاض نسبي في معدل نجاح الهجمات (Attack Success Rate) مع تدخل بسيط جداً لعدد 0.1% فقط من الأعصاب. إضافةً إلى ذلك، نجحت في الحفاظ على 97% من أداء النموذج في الاختبارات الطبيعية، مما يؤكد فعاليتها وقوتها وقابليتها للتوسع.

تقنية DeCNIP تمثل خطوة نوعية نحو تعزيز أمان نماذج الذكاء الاصطناعي وضمان موثوقيتها. فكيف تساهم هذه التطورات في تشكيل مستقبل الذكاء الاصطناعي؟.