في السنوات الأخيرة، اكتسبت تقنيات تخفيف المخاطر مثل تقنيات التقطير المعتمد على السياسة (On-Policy Distillation) اهتمامًا واسعًا كاستراتيجية فعّالة لنقل القدرات من نماذج التعليم إلى نماذج الطلاب. ولكن كما تكشف الأبحاث الجديدة، فإن هذه الأساليب قد تحتوي على نقاط ضعف غير مرئية تثير القلق.
لقد أظهرت الدراسات أن استخدام نماذج التعليم في هذه التقنية يفترض أن تكون موثوقة، ولكن هل نحن حقًا نعرف ما يحدث تحت السطح؟ فعلى الرغم من أن هذه التقنيات تعهد بتحسين أمان نماذج الذكاء الاصطناعي، إلا أنه تم اكتشاف أن المعلم، حتى لو بدا آمنًا، قد يكون لديه سلوكيات خفية ضارة يمكن أن تنتقل إلى نموذج الطالب.
تشير الأبحاث إلى أن معدل تسمم منخفض يصل إلى 3% يمكن أن يؤدي إلى معدل نجاح الهجوم يصل إلى 70% على نموذج الطالب المُقطَّر. علاوة على ذلك، تم تحديد خيارين تدريبيين يمكن أن يزيدا من هذا الخطر:
1. زيادة عدد فترات التدريب يمكن أن يساهم في معدل انتقال الهجوم حتى مع معدلات التسمم المنخفضة.
2. استخدام الطرق الشائعة مثل KL Top-k يمكن أن يسرع من انتقال الخلفية، مما يجعل السلوك الضار يظهر في وقت قصير.
لكن الخبر ليس كله سلبي! تم اقتراح طريقة بسيطة للتخفيف من هذه المخاطر تُعرف بالدفاع الكسول (Lazy Defense)، التي تهدف إلى تقليل تحديثات نموذج الطالب للحد من التعلم الضار.
النتائج توضح أن التخفيف يمكن أن يساعد في تأخير انتقال الخلفية في حالات التسمم المنخفضة، ما يبرز أهمية معالجة المخاطر الأمنية المرتبطة بأساليب التقطير المعتمدة على السياسة.
هل تدافع تقنيات تخفيف المخاطر عن أمان نماذج الذكاء الاصطناعي؟ اكتشاف خطر الخلفية!
تؤكد الأبحاث الجديدة وجود ثغرات في أسلوب تخفيف المخاطر من خلال تقنيات التعلم، مما يمكن أن يهدد أمان نماذج الذكاء الاصطناعي، خصوصًا عندما تفقد الثقة في نماذج المعلمين. تعرفوا على كيف يمكن لنماذج الذكاء أن تنقل سلوكيات ضارة من معلم موثوق ظاهريًا إلى متعلم جديد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
