في عالم الذكاء الاصطناعي والنماذج اللغوية الضخمة (Large Language Models)، يعد تقييم فعالية هجمات الاختراق أمراً مهماً للحفاظ على الأمان. ومع ذلك، غالباً ما تركز الدراسات الحالية على معدل نجاح الهجمات (Attack Success Rate - ASR) فقط، دون أخذ ميزانيات الهجمات بعين الاعتبار، مما يخلق مقارنات غير عادلة.
لتصحيح هذا الأمر، تم تقديم بروتوكول Fair-ASR، الذي يسعى إلى تقييم هجمات الاختراق للنماذج اللغوية الضخمة تحت ميزانيات استدعاء مستهدفة مشتركة، حيث تعتمد المقارنة على استدعاءات الأهداف كأساس مرئي وحيادي. كما يتضمن البروتوكول تتبع استدعاءات المهاجمين بشكل منفصل لتحليل الكفاءة.
من خلال تطبيق هذا البروتوكول، تم إعادة تقييم 11 هجمة نموذجية، وظهرت تغييرات ملحوظة في تصنيفات الهجمات بناءً على ميزانيات استدعاء الأهداف. أظهر البروتوكول أن التغيرات العشوائية البسيطة وقوالب البرمجة اليدوية لا تزال تتنافس بقوة تحت ظروف متساوية لاستدعاءات الهدف، وأنه لا توجد طريقة معتمدة على النماذج اللغوية الضخمة أثبتت كفاءتها في كلا الاستدعائين.
استجابةً لفجوة الكفاءة هذه، تم تقديم الهجوم الجديد ReCode، وهو هجوم فعال من حيث الميزانية يجمع بين إعادة كتابة الحساسية مع اثنين من التقنيات ذات التكلفة المنخفضة التي تم تحديدها من خلال Fair-ASR. تحت ميزانية مكونة من 20 استدعاءً مستهدفاً، تحقق ReCode معدل نجاح هو 85% عند العمل مع GPT-5، مع متطلبات متوسطة تبلغ 7.19 من استدعاءات المهاجمين لكل طلب، مما يدل على كفاءة عالية في كليهما.
إن هذا البحث الجديد يوفر أُطر عمل واعدة لضمان سلامة النماذج اللغوية الضخمة ويحفز النقاش حول أساليب التقييم الأكثر دقة. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
تقييم جديد لهجمات اختراق النماذج اللغوية الضخمة: الكشف عن نجاحات غير عادلة!
تقديم بروتوكول Fair-ASR يعيد تقييم فعالية هجمات اختراق النماذج اللغوية الضخمة بناءً على ميزانيات استدعاء مستهدفة مشتركة. كما تم تقديم هجوم جديد يحمل اسم ReCode لتحقيق كفاءة أكبر في الاستهداف.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
