في السنوات الأخيرة، اكتسبت تقنيات تخفيف المخاطر مثل تقنيات التقطير المعتمد على السياسة (On-Policy Distillation) اهتمامًا واسعًا كاستراتيجية فعّالة لنقل القدرات من نماذج التعليم إلى نماذج الطلاب. ولكن كما تكشف الأبحاث الجديدة، فإن هذه الأساليب قد تحتوي على نقاط ضعف غير مرئية تثير القلق.

لقد أظهرت الدراسات أن استخدام نماذج التعليم في هذه التقنية يفترض أن تكون موثوقة، ولكن هل نحن حقًا نعرف ما يحدث تحت السطح؟ فعلى الرغم من أن هذه التقنيات تعهد بتحسين أمان نماذج الذكاء الاصطناعي، إلا أنه تم اكتشاف أن المعلم، حتى لو بدا آمنًا، قد يكون لديه سلوكيات خفية ضارة يمكن أن تنتقل إلى نموذج الطالب.

تشير الأبحاث إلى أن معدل تسمم منخفض يصل إلى 3% يمكن أن يؤدي إلى معدل نجاح الهجوم يصل إلى 70% على نموذج الطالب المُقطَّر. علاوة على ذلك، تم تحديد خيارين تدريبيين يمكن أن يزيدا من هذا الخطر:
1. زيادة عدد فترات التدريب يمكن أن يساهم في معدل انتقال الهجوم حتى مع معدلات التسمم المنخفضة.
2. استخدام الطرق الشائعة مثل KL Top-k يمكن أن يسرع من انتقال الخلفية، مما يجعل السلوك الضار يظهر في وقت قصير.

لكن الخبر ليس كله سلبي! تم اقتراح طريقة بسيطة للتخفيف من هذه المخاطر تُعرف بالدفاع الكسول (Lazy Defense)، التي تهدف إلى تقليل تحديثات نموذج الطالب للحد من التعلم الضار.

النتائج توضح أن التخفيف يمكن أن يساعد في تأخير انتقال الخلفية في حالات التسمم المنخفضة، ما يبرز أهمية معالجة المخاطر الأمنية المرتبطة بأساليب التقطير المعتمدة على السياسة.