تعتبر نماذج اللغات الضخمة (Large Language Models) من أبرز الابتكارات التكنولوجية، لكن رغم الجهود الكبيرة لتوافقها مع القيم الإنسانية، لا تزال هذه النماذج تتعرض لهجمات اختراق تهدف إلى تجاوز الحواجز الأمنية وطلب استجابات مضرة. تكمن المشكلة في أن العديد من أساليب الدفاع المعمول بها لا تكفي للتصدي لأساليب الاختراق المعتمدة على التحسين، والتي يمكن أن تنتج عنها عبارات متقنة لكنها مضرة.
لذا، تم تقديم إطار العمل الجديد SAFEGuard، الذي يعتمد على قياسات للطلاقة مبتكرة مستندة إلى فرق توزيع الطبقات ودرجة التعقيد، بالإضافة إلى تحليل العبارات الضارة من خلال تقنيات مطابقة التدرجات. يركز الإطار على ملاحظة رئيسية: العبارات ذات الطلاقة العالية تحتفظ بنواياها الخبيثة بالقرب من العبارات الضارة، بينما تميل العبارات الضارة ذات الدلالات المعقدة إلى إدخال تسلسلات غير منطقية.
التقييمات التجريبية أظهرت أن SAFEGuard يتفوق باستمرار على المعايير الحالية، مما يحقق تحسينًا ملحوظًا في دقة الكشف عبر أنواع مختلفة من الهجمات المعتمدة على التحسين. هذا يعكس فعالية SAFEGuard في مواجهة هجمات الاختراق المتطورة والمتزايدة.
SAFEGuard: حصن الذكاء الاصطناعي ضد هجمات الاختراق من خلال تحليل معزز وفحص الطلاقة
تقدم SAFEGuard إطار عمل متكامل لرصد هجمات الاختراق المعتمدة على التحسين باستخدام قياسات للطلاقة وتحليل دلالات ضارة. أظهرت النتائج أن الإطار متفوق على الأساليب التقليدية في الكشف عن هذه الأنواع من الهجمات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
