تعتبر نماذج اللغات الضخمة (Large Language Models) من أبرز الابتكارات التكنولوجية، لكن رغم الجهود الكبيرة لتوافقها مع القيم الإنسانية، لا تزال هذه النماذج تتعرض لهجمات اختراق تهدف إلى تجاوز الحواجز الأمنية وطلب استجابات مضرة. تكمن المشكلة في أن العديد من أساليب الدفاع المعمول بها لا تكفي للتصدي لأساليب الاختراق المعتمدة على التحسين، والتي يمكن أن تنتج عنها عبارات متقنة لكنها مضرة.

لذا، تم تقديم إطار العمل الجديد SAFEGuard، الذي يعتمد على قياسات للطلاقة مبتكرة مستندة إلى فرق توزيع الطبقات ودرجة التعقيد، بالإضافة إلى تحليل العبارات الضارة من خلال تقنيات مطابقة التدرجات. يركز الإطار على ملاحظة رئيسية: العبارات ذات الطلاقة العالية تحتفظ بنواياها الخبيثة بالقرب من العبارات الضارة، بينما تميل العبارات الضارة ذات الدلالات المعقدة إلى إدخال تسلسلات غير منطقية.

التقييمات التجريبية أظهرت أن SAFEGuard يتفوق باستمرار على المعايير الحالية، مما يحقق تحسينًا ملحوظًا في دقة الكشف عبر أنواع مختلفة من الهجمات المعتمدة على التحسين. هذا يعكس فعالية SAFEGuard في مواجهة هجمات الاختراق المتطورة والمتزايدة.