تسارعت تطورات النماذج اللغوية الضخمة (LLMs) بشكل مذهل، مما أثار مخاوف متزايدة بشأن أمانها. في الآونة الأخيرة، تم اقتراح أساليب للكشف والدفاع ضد الهجمات، بما في ذلك تقنيات الدفاع أثناء مرحلة فك التشفير التي تستغل حالات النماذج الخفية. ومع ذلك، فإن هذه التقنيات الحالية تعاني من ائتمانات ملحوظة.

أولاً، تؤدي التعزيزات الأمانية إلى تقديم توازن بين الأمان والرفض المفرط، حيث يتسبب تعزيز الأمان في تقليل فعالية النموذج في التعامل مع الاستفسارات العادية. ثانياً، تعتمد العديد من هذه الأساليب على الحالات الخفية الداخلية، مما يجعلها مقيدة بهياكل معينة، مما يؤدي إلى نسبة مرتفعة من التحميل وقابلية تعميم محدودة عبر النماذج.

للتغلب على هذه القيود، قمنا بتقديم تقنية جديدة تسمى LADE (إشارات الأمان الخفية للدفاع)، التي تستفيد من إشارات الأمان المستخرجة عن طريق تمييز بين الاستفسارات الضارة والعادية باستخدام المعرفة المظلمة (Dark Knowledge). فكرنا الأساسي هو أنه بخلاف رموز الرفض السطحية، تحتوي المعرفة المظلمة على إشارات أمان خفية تحدد الرموز التي تختلف احتمالياتها بشدة بين الاستفسارات الضارة والعادية.

لقد أظهرنا أن هذه الإشارات تتماشى باستمرار عبر النماذج اللغوية الضخمة، مما يشكل اتجاهًا لا يعتمد على النموذج ويظهر من توافق الأمان. يتكون نظام LADE من ثلاثة مكونات:
1. استخراج إشارات الأمان الخفية من المعرفة المظلمة، الذي يختار الرموز العليا ذات التمييز الأماني من توزيع احتمالية الرمز الأول.
2. معادلة الرموز، التي تربط هذه الرموز عبر مختلف معالجات الرموز لتمكين التطبيق المعتمد على النموذج.
3. التمييز القائم على kNN، الذي يصنف الاستفسارات من خلال البحث القائم على أقرب الجيران فوق الرموز المرتبطة.

عبر نماذج متنوعة وقياسات مختلفة، أثبت نظام LADE أنه قوي ضد مجموعة واسعة من هجمات القرصنة، مما يقلل من معدلات نجاح الهجوم مع الحفاظ على توازن تنافسي بين الأمان والفائدة.