في زمن يتزايد فيه الاعتماد على نماذج الذكاء الاصطناعي، يبرز سؤال ملح حول كيفية حماية هذه النماذج من الهجمات الضارة. وقد أظهرت الأبحاث الأخيرة أن تقنية Fine-tuning-as-a-service توفر للمستخدمين القدرة على تعديل نماذج الذكاء الاصطناعي وفقاً لبياناتهم الخاصة، لكنها في الوقت نفسه تفتح المجال أمام هجمات التحوير الضار. فبمجرد إدخال كمية صغيرة من البيانات الضارة ضمن مجموعة تعديل عادية، يمكن أن تتدهور سلامة النموذج بشكل كبير.
للتصدي لهذه المشكلة، تم تطوير دفاعين جديدين يعملان على تحسين مرحلة التوافق في نماذج الذكاء الاصطناعي، وهما Vaccine وBooster. حيث يقوم Vaccine بتحسين مناعة التمثيلات المخفية ضد التغيرات الناتجة عن التعديل الضار، بينما يعمل Booster على محاكاة التحديثات الضارة للأوزان وتقليل آثارها أثناء عملية التوافق.
وفي خطوة مبتكرة، اقترح الباحثون دمج هذين الدفاعين في نظام واحد يُعرف بـ VaccineBooster، الذي يجمع بين تقنيات التحوير والانخفاض في مستويات التدرج باستخدام كل خطوة تدريب. وعند اختباره على نموذج Llama-2-7B بعد تعريضه للهجوم من خلال تعديلات ضارة، أظهر VaccineBooster أقل نتيجة في تقييم الاعتدال من OpenAI، وهي 0.315، بينما احتفظ النسخة المثالية من Booster بمعدل رفض مرتفع جداً بلغ 50% بعد الهجوم.
تعكس هذه النتائج وجود تبادل: حيث أن التحوير للتمثيلات يُقلل بشكل أساسي من المحتوى الضار، بينما يعمل انخفاض التدرج على الحفاظ على سلوك الرفض الصريح. وبالتالي، يوفر هذا البحث إرشادات عملية لتحديد الأولويات بين أمان المحتوى والاحتفاظ بالرفض عندما تكون النماذج متعرضة لتعديلات غير موثوقة.
هل تعتقد أن هذه التقنيات المبتكرة ستكون كافية لحماية نماذج الذكاء الاصطناعي من الأخطار المتزايدة؟ شاركونا آراءكم في التعليقات.
حماية أفضل للمحتوى أو رفض أكثر قوة؟ اكتشفوا دفاع التحوير الهجين للذكاء الاصطناعي!
تقدم تقنية Fine-tuning-as-a-service إمكانية تعديل نماذج الذكاء الاصطناعي وفقاً لبيانات المستخدم، لكنها تعرضها أيضاً لهجمات تعديل ضارة. تعرفوا على الدفاع الهجين VaccineBooster الذي يُحسن من أمان المحتوى من خلال تقنيات مبتكرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
