تواجه نماذج اللغات الضخمة (Large Language Models) تحديات كبيرة في مجال الأمان، إذ تظل هذه النماذج عرضة لنطاق متزايد من الهجمات. من بين هذه التهديدات، تظهر هجمات "جيلبريك" (Jailbreak) التي تتجاوز آليات الأمان من خلال تهيئة المحفزات بشكل مدروس، بالإضافة إلى الهجمات التي تستهدف الخلايا العصبية الأكثر أهمية بعد النشر.

تستغل هذه الهجمات نقطة ضعف شائعة تتمثل في تركيز المعلومات ذات الصلة بالأمان في مجموعة صغيرة من الخلايا العصبية. لتقديم حل فعال، تم تقديم NeuronGuard، وهو نمط دفاعي جديد يعمل خلال مرحلة التعديل الدقيق للنماذج. يجري NeuronGuard إعادة توزيع إشارات الأمان عبر مجموعة أكبر من الخلايا العصبية، مما يعزز من مقاومة النماذج ضد كلا نوعي الهجمات.

هذا النظام يقوم بشكل دوري بتحديث تصنيف الخلايا العصبية الحرجة، ويفرض سلوك الرفض في حالة استئصال الخلايا العصبية المتعمدة. كما يطبق تقنيات مثل تقليل KL divergence لضمان التناسق في التوزيع. من خلال استراتيجية آلة التدرج العشوائي، يتم الحفاظ على الكفاءة في المهام النهائية من خلال حل النزاعات بين أهداف الدفاع والمهام.

تقدم التجارب التي أُجريت على ثلاثة نماذج لغوية ضخمة وستة استراتيجيات هجومية متطورة، ضمانات رسمية بأن نظام NeuronGuard يقلل بشكل صارم من الحد الأقصى لمعدل نجاح الهجوم (ASR). وفي وبعد الاختبارات، تم تأكيد قدرته على الحفاظ على دقة المهام مع معدلات قرب صفر لمعدل نجاح الهجمات حتى أمام الخصوم القابلة للتكيف.

يبدو أن NeuronGuard يفتح آفاقًا جديدة لأمان نماذج اللغات الضخمة وقد يشكل نقطة تحول في كيفية تعزيز هذه النماذج ضد التهديدات المتزايدة. ما هي أفكاركم حول هذا التطور الثوري؟ شاركونا في التعليقات!