في عالم الذكاء الاصطناعي، تُعد نماذج اللغة الكبيرة (LLMs) واحدة من الأدوات الأكثر قوة. ومع ذلك، فإن استخدام أساليب التعديل الودي، التي تُعنى بتطوير أداء النماذج مع الحفاظ على سلامتها، قد يضعف بشكل كبير من توافق الأمان. دراسة جديدة تكشف كيف يمكن أن تكون هذه العملية هشة، مما يجعل جهودنا لتطوير سلوكيات الرفض أكثر عرضة للفشل.

بدلاً من تبرير هذا الفشل بالاعتماد على الصراعات الناتجة عن التدرجات، تقترح الدراسة تفسيرًا جديدًا يستند إلى مفهوم 'فيشر الجيومتري'. حيث يشير الباحثون إلى أن مستويات الأمان هنا بسيطة وعميقة، مما يؤدي إلى هندسة أمان أكثر سلاسة. بعد القيام بأكثر من 100 تجربة تعديل ودي، تمت إعادة صياغة مسار التوجيه بشكل انتقائي، مما يعكس هشاشة النتائج: في حين أن معدلات الهجوم المرتفعة قد تؤدي إلى انهيار الأمان، فإن الأداء العام للنموذج يتدهور بشكل معتدل.

يتطلب الأمر فهم هذه الآلية العميقة لتحسين الأمان، حيث تشير النتائج إلى أن Few Safety Examples - أي القليل من الأمثلة ذات الصلة بالأمان - يمكن أن تعيد تشكيل سلوكيات الرفض. من المثير للاهتمام أيضًا أن تقنيات LoRA وASAM أظهرت فعالية في الحد من الانهيار المبكر من خلال تقليل شدّة النماذج، ولكن هذه الحماية تضعف مع زيادة حجم التعديلات.

في المجمل، يُعتبر فشل الأمان نتيجة لتعطيل آلية التوجيه الناتجة ذات الرتبة المنخفضة، مما يتيح للباحثين اكتشاف حلول جديدة لتحسين أمان نماذجهم. ما رأيكم في هذه النتائج المثيرة؟ شاركونا في التعليقات.