في عالم الذكاء الاصطناعي، تبرز أهمية الأمان كفرضية رئيسية في تصميم نماذج اللغة الكبيرة (Large Language Models). يجري النظر إلى توافق الأمان غالبًا على أنه خاصية موزعة عبر الشبكة بالكامل، إلا أن تحليلات عديدة تثبت هشاشة هذه الفرضية، مما يشير إلى أن سلوك الرفض قد يكون مركزًا في مجموعة أصغر من المعلمات.
في هذا البحث، تم التركيز على معرفة كيف وأين يتم تشفير سلوك الرفض المتوافق مع الأمان من خلال عملية نقل وزنات من نماذج متوافقة إلى نماذج أساسية غير متوافقة، وبمستويات دقة متنوعة. باستخدام مجموعتين من النماذج المفتوحة الوزن وأربعة معايير للأمان، تم إجراء تجارب مقارنة لتحليل تأثيرات استبدال وزنات الانتباه ووزنات وحدات متعددة الطبقات (MLP) ومناطق الطبقات المتجاورة وكتل MLP.
أظهرت النتائج أن نقل سلوك الرفض يتصدره وزنات MLP، حيث يمكّن استبدال هذه المعلمات من استعادة رفض أفضل من المحفزات الضارة بمقدار 2.7 مرة من الأنشطة الأخرى عبر معايير الاختبار المختلفة. داخل تكديس MLP، تتجمع المعلمات المعنية بسلوك الرفض بشكل متسق في منتصف الشبكة، حيث تم اختيار الكتلة الممتدة عبر الطبقات 8-11 في كل التجارب.
وعلاوة على ذلك، تُظهر النتائج أن تركيب مكونات الأمان ليس تراكميًا؛ ففي خمس من أصل ست مسارات جشعة، يمكن أن يؤدي إضافة المزيد من الكتل المتوافقة إلى انخفاض في أداء الرفض.
تظهر هذه النتائج أن توافق الأمان في نماذج اللغة الكبيرة الحالية يعتمد على التركيز والحساسية للتفاعل، مما يفتح مجالًا جديدًا للبحث في كيفية تحسين الأمان وتحقيق تدخلات مركزة.
الإبداع في الذكاء الاصطناعي: كيفية تركيز سلوك الرفض في نماذج اللغة الكبيرة!
تسليط الضوء على كيفية تحسين أمان نماذج اللغة الكبيرة من خلال فهم سلوك الرفض. يعتمد البحث على تحليل دقيق لمكونات الشبكة والتجارب مستندة إلى نماذج مفتوحة الوزن.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
