في ظل التطورات المتسارعة في مجال نماذج اللغات الضخمة (Large Language Models)، تثير عمليات الإلغاء (Abliteration) اهتماماً كبيراً كأحد أبرز القضايا المتعلقة بالأمان. حيث تعني عمليات الإلغاء إزالة قدرات الرفض من هذه النماذج، مما يتيح لها تجاوز عمليات التوافق بعد التدريب باستخدام مجموعة صغيرة من العوامل المتعارضة.
ويعد هذا الأمر بمثابة خطر كبير، إذ أثبتت الأبحاث أن الدفاعات الحالية غالباً ما تغفل عن سبب عملية الإلغاء، وهو مدى سهولة استخراج اتجاه الرفض. لذلك، نحتاج إلى استراتيجيات فعالة للتصدي لهذه المشكلة المعقدة.
في ضوء هذا التحدي، تم تقديم طريقة جديدة تعتمد على تعديل الأوزان لاخفاء إشارات الرفض. تقوم هذه الطريقة بتطبيق تحديثات تراتبية (rank-k updates) على مصفوفات كتاب تيار البقايا، مما يُستبدل من خلاله التفعيلات التي تحفز الرفض بأسماء مستعارة عشوائية. وبفضل هذه الاستراتيجية، يمكن الحفاظ على سلوك النموذج الأصلي والتقليل من الآثار السلبية.
عند اختبار نموذج Llama-3-8B، تمكنت هذه الطريقة الجديدة من تحسين درجات رفض ما بعد عملية الإلغاء بمعدل 2.16 نقطة مقارنةً بالأساس غير المحمي، مع تكبد نقصان ضئيل لا يتجاوز 0.5 نقطة في مؤشر MMLU. وبالمثل، في نموذج Gemma-2-9B، حصلنا على تحسين قدره 14.70 نقطة في درجات الرفض بعد الإلغاء، مع الحفاظ على نسب الإخراج الضارة شبه مماثلة للأساس، رغم تكبد كلفة أكبر في الأداء.
وهكذا، تقدم هذه الدراسة رؤى جديدة وخطوات عملية لتعزيز أمان نماذج اللغات الضخمة، مما يعد إنجازاً مهماً في مسعى توفير ذكاء اصطناعي أكثر موثوقية وأماناً.
تحصين نماذج الذكاء الاصطناعي ضد عمليات الإلغاء: طريقة جديدة تهدف لتعزيز القدرات الآمنة!
تتزايد المخاوف حول إلغاء قدرات الرفض في نماذج اللغات الضخمة، مما قد يؤثر سلباً على السلامة. نقدم في هذا المقال طريقة مبتكرة لتحسين الأمان عن طريق إخفاء الإشارات المسببة للإلغاء وتحسين الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
