يشكّل أمان نماذج اللغات الضخمة (LLMs) تحديًا كبيرًا في مجال الذكاء الاصطناعي، رغم جهود التوافق المكثفة التي بُذلت لتقديم استجابات آمنة. تحتوي النماذج على هياكل داخلية تتعلق بسلوكيات الأمان، والتي لم يتم فهمها بشكل كامل حتى الآن. في دراسة جديدة، تم تحليل أمان نماذج اللغات الضخمة من منظور قابلية تفسير الآليات، وتعريف دائرة أمان متعددة المراحل تنظم سلوكيات الرفض. تتضمن هذه الدائرة ثلاث عناصر رئيسية:

1. **رؤوس الكشف عن الأذى (Harmful Detection Heads)**: تستجيب لهذه الإدخالات الضارة، وتلعب دورًا أساسيًا في تحديد المحتوى غير الآمن.

2. **خلايا الأمان (Safety Neurons)**: تعمل على توصيل وتثبيت إشارات الأمان وتحسين فعالية استجابة النماذج.

3. **رؤوس الرفض (Refusal Heads)**: تحول الإشارات المكتسبة إلى استجابات آمنة وموثوقة.

أجريت الدراسة باستخدام تدخلات مستهدفة على رؤوس الانتباه والخلايا العصبية، مما أظهر أدلة سببية تتماشى مع تنظيم هذه الدائرة. تم التحقق من أن تثبيط رؤوس الكشف عن الأذى يؤثر سلبًا على سلوكيات الرفض، مما يؤكد أهمية هذه التجارب في تعزيز أمان النماذج في سياقات مختلفة.

عبر ستة نماذج لغات ضخمة، أظهرت تقنية تحسين الوزن المُستندة إلى الدائرة تحسنًا في معدلات الأمان تحت الهجمات بنسبة 26.5%، مع انخفاض طفيف في الدقة بنسبة 1.7% عبر أربعة معايير قياسية. تدعم نتائج هذه الدراسة تفسيرًا على مستوى الدائرة لسلامة نماذج اللغات الضخمة، وتظهر أن التجريدات الآلية يمكن أن تكشف أنماطًا مستقرة وقابلة للنقل تعزز السلوك المتوافق.

في ضوء هذه النتائج المثيرة، يبقى السؤال: كيف يمكن استخدام هذه الآليات لتعزيز الأمان في تطبيقات الذكاء الاصطناعي المستقبلية؟ شاركونا آرائكم في التعليقات.