في ظل التطورات المتسارعة في مجال نماذج اللغات الضخمة (Large Language Models)، تثير عمليات الإلغاء (Abliteration) اهتماماً كبيراً كأحد أبرز القضايا المتعلقة بالأمان. حيث تعني عمليات الإلغاء إزالة قدرات الرفض من هذه النماذج، مما يتيح لها تجاوز عمليات التوافق بعد التدريب باستخدام مجموعة صغيرة من العوامل المتعارضة.

ويعد هذا الأمر بمثابة خطر كبير، إذ أثبتت الأبحاث أن الدفاعات الحالية غالباً ما تغفل عن سبب عملية الإلغاء، وهو مدى سهولة استخراج اتجاه الرفض. لذلك، نحتاج إلى استراتيجيات فعالة للتصدي لهذه المشكلة المعقدة.

في ضوء هذا التحدي، تم تقديم طريقة جديدة تعتمد على تعديل الأوزان لاخفاء إشارات الرفض. تقوم هذه الطريقة بتطبيق تحديثات تراتبية (rank-k updates) على مصفوفات كتاب تيار البقايا، مما يُستبدل من خلاله التفعيلات التي تحفز الرفض بأسماء مستعارة عشوائية. وبفضل هذه الاستراتيجية، يمكن الحفاظ على سلوك النموذج الأصلي والتقليل من الآثار السلبية.

عند اختبار نموذج Llama-3-8B، تمكنت هذه الطريقة الجديدة من تحسين درجات رفض ما بعد عملية الإلغاء بمعدل 2.16 نقطة مقارنةً بالأساس غير المحمي، مع تكبد نقصان ضئيل لا يتجاوز 0.5 نقطة في مؤشر MMLU. وبالمثل، في نموذج Gemma-2-9B، حصلنا على تحسين قدره 14.70 نقطة في درجات الرفض بعد الإلغاء، مع الحفاظ على نسب الإخراج الضارة شبه مماثلة للأساس، رغم تكبد كلفة أكبر في الأداء.

وهكذا، تقدم هذه الدراسة رؤى جديدة وخطوات عملية لتعزيز أمان نماذج اللغات الضخمة، مما يعد إنجازاً مهماً في مسعى توفير ذكاء اصطناعي أكثر موثوقية وأماناً.