في عالم الذكاء الاصطناعي، يعكف الباحثون على دراسة كيفية تأثير التذييلات العدائية على نماذج اللغة الكبرى (Large Language Models)، حيث تعتمد هذه الهجمات على تقنيات تحسين دقيقة تُنتج تذييلات قصيرة وغير منطقية يتم إضافتها إلى المدخلات لتوليد محتوى مرفوض. ولكن ما هو الأكثر إثارة للاهتمام هو أن هذه التذييلات غالبًا ما تكون قابلة للنقل، حيث تنجح في نماذج وطلبات لم يتم تصميمها خصيصًا لها.

ومع ذلك، وعلى الرغم من جاذبية هذه القضية، إلا أن هناك نقصًا في التحليلات الدقيقة حول متى ولماذا يحدث النقل. لملء هذا الفراغ، قام الباحثون بتحديد ثلاث خصائص إحصائية ترتبط ارتباطًا قويًا بنجاح النقل عبر مجموعة متنوعة من الإعدادات التجريبية:

1. **مدى تفعيل الطلبات التي لا تحتوي على تذييلات لاتجاه الرفض الداخلي للنموذج.**
2. **مدى قوة التذييلات في دفع النموذج بعيدًا عن هذا الاتجاه.**
3. **كمية التحولات في الاتجاهات التي لا تتعلق بالرفض.**

بينما كان يُعتقد أن تشابه المعاني للطلبات يلعب دورًا هامًا، توصلت الأبحاث إلى أنه يرتبط بنجاح النقل بصورة ضعيفة. يُظهر هذا الاكتشاف أهمية فهم قابلية النقل بشكل أكثر تفصيلًا، وذلك باستخدام التجارب التدخلية لإظهار كيف يمكن أن ترجمة هذه التحليلات الإحصائية إلى تحسينات عملية في نجاح الهجمات.