تواجه نماذج اللغات الضخمة (Large Language Models) العديد من التحديات الأمنية، حيث تظهر تهديدات جديدة تتعلق بالهندسة التمثيلية. من بين هذه التهديدات، نجد هجمات تعتبر رخيصة وسريعة، حيث يمكن للمهاجمين التقدير الاتجاهات الرافضة والبحث عن تعديلات على المصفوفات التي قد تؤدي إلى تقويض أمان النموذج دون الحاجة إلى التدريب القائم على التدرج.

لتعزيز الأمان، قدم الباحثون تقنية جديدة تُعرف باسم 'Bait-and-Recover'، وهي عبارة عن دفاع على مستوى الوزن يوضع فيه مُعدّل طُعم (bait adapter) في النقاط التي يقرأ فيها المهاجمون الأنشطة، ويرافقه مُعدّل استعادة (recovery adapter) في الطبقة التالية. يتم تدريب هذا النظام عبر توجيه التدرج، مما يفصل بين مسار الملاحظة ومسار السلوك.

من خلال تشويش الإشارة الباقية المستخدمة في القياس، تعمل هذه التقنية على تعطيل بحث المهاجم عن التعديلات، في حين تقوم طبقة الاستعادة باستعادة العمليات النظيفة في الاتجاهات السفلية. أظهرت التجارب مع أربعة نماذج مفتوحة الوزن أن هذه الدفاعات تُعلي معدل الرفض الأدنى ضد عمليات البحث المدمرة من 16.25% إلى 71.75%، مع تأثير ضئيل على المؤشرات العامة.

تُعتبر تقنية 'Bait-and-Recover' خطوة رائدة في توفير تدابير أمنية إضافية لنماذج اللغات الضخمة، عبر إبطال الافتراضات الأساسية التي تعتمد عليها هذه الهجمات، مما يجعلها مكملاً عمليًا للتدريب على سلامة السلوك.