في عالم الذكاء الاصطناعي، شهدنا توسعاً سريعاً في استخدام نماذج اللغة الكبيرة (Large Language Models) وطرق التخصيص الفعالة للمعاملات (Parameter-Efficient Fine-Tuning). ومع زيادة الاعتماد على هذه النماذج، تزداد مخاطر الهجمات الخلفية بشكل ملحوظ. وعادةً ما تعتمد طرق تطهير الهجمات الخلفية على مجموعة من الافتراضات القاسية مثل المعرفة المسبقة عن المحفزات أو الوصول إلى مرجعيات نظيفة، وهو ما يحد من فاعليتها.
لتجاوز هذه التحديات، تقدم دراستنا الجديدة طريقة مبتكرة لتطهير نماذج (LoRA) المعززة بدون الحاجة لتلك الافتراضات المسبقة ودون الحاجة لإعادة تدريب المعاملات المشبوهة بعد وقوع الهجوم. الهدف من هذه الطريقة هو تحقيق تخفيض كبير في معدلات نجاح الهجمات (Attack Success Rate) مع الحفاظ على فعالية النموذج الأساسية والقدرات الجديدة المكتسبة من خلال المساعد.
من خلال سلسلة من الدراسات التجريبية، قمنا بتوسيع نهجنا من طبقة منفردة ضمن إعدادات تصنيف النصوص إلى نماذج لغة كاملة في المهام التوليدية. باستخدام تنسيق بيانات دقيق وتقدير خصائص، استخرجنا اتجاهات خلفية عالية الدقة، وقمنا بإنشاء فضاءات فارغة متعامدة لكل طبقة أو رأس.
تعتمد طريقتنا على إسقاط الفضاء الفارغ، مما يقلل معدل نجاح الهجمات من قرابة 100% إلى أقل من 10%، مع الحفاظ على أداء النموذج الأساسي وقدرات المساعد المكتسبة أثناء تكييف المهام اللاحقة.
كيفية حماية نماذج اللغة الكبيرة من هجمات الخلفية باستخدام تقنية مبتكرة!
تقدم هذه الدراسة طريقة جديدة للتخلص من هجمات الخلفية على نماذج اللغة الكبيرة (LLMs) بدون الحاجة لافتراضات مسبقة، مما يُعزز من أمان هذه النماذج ويقلل من معدلات النجاح المهاجم. التقنية الجديدة تستهدف الحفاظ على الأداء الأساسي للنموذج وكفاءته الجديدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
