مع التقدم السريع لنماذج اللغات الضخمة (LLMs)، أصبحت مسألة سلامتها مصدر قلق رئيسي وموضوعاً يستدعي دراسة عميقة. ورغم الجهود الكبيرة التي تُبذل لتوافق الأمان، لا تزال هذه النماذج معرضة لهجمات اختراق السجن. وبينما تبقى الأسباب الجذرية لهذه الثغرات غامضة، يبرز البحث الحالي كخطوة جديدة لتحليل هذه الأنماط.

في هذه الدراسة، نركز على ظاهرة اختراق الدفع المستمر، حيث يمكن لنقل تعليمات معينة أن يزيد بشكل كبير من معدلات نجاح اختراق السجن. ومن خلال تحليل دقيق لآليات هذا الظاهرة، اكتشفنا أن سلوك الاختراق يرجع إلى المنافسة الداخلية بين دافع الاستمرار في النموذج والدفاعات الأمنية الناتجة عن التدريب المناسب.

تتطلب هذه الآلية توجيه استراتيجيات جديدة تضمن أمان النماذج. لذلك، يقترح الباحثون إستراتيجية مبتكرة تُعرف باسم توجيه المنافسة الرأسية، التي تعتمد على الاستفادة من المنافسة بين رؤوس الأمان ورؤوس الاستمرار، مما يقلل من احتمالات التوليد الضار دون الحاجة إلى زيادة الحمل الحاسوبي.

إن فهم هذه الديناميكيات يمهد الطريق لتحسينات هامة في سلامة النماذج ويساهم في حماية استخدامها في التطبيقات الحساسة.