في عالم الذكاء الاصطناعي، يجب أن نولي أهمية خاصة لتقييم سلامة نماذج اللغة الكبيرة (Large Language Models). تشير الأبحاث الأخيرة إلى أن الطرق التقليدية التي تعتمد فقط على معدل نجاح الهجمات (Attack Success Rate - ASR) لم تعد كافية. فالمسألة تتجاوز مجرد تحديد ما إذا كان النموذج قد قدم محتوى ضار، بل تمتد إلى فهم نية النموذج من خلال تحليله بدقة أكبر.

تظهر الدراسة التي نُشرت على منصة arXiv، أن نتائج الأداء غير الضار قد تكون ناتجة عن مجموعة متنوعة من الأسباب. فعندما يواجه النموذج مهمة ضارة، يمكن أن يستجيب بعدم الانخراط أو الفشل في إنجاز المهمة، أو حتى الاستجابة لطلب آخر بشكل غير متوقع. هذه الفوارق تتضح بشكل خاص عند استخدام أوامر تجعل النية غير واضحة، حيث يمكن أن يخفي معدل النجاح المنخفض (ASR) مستوى الانخراط الفعلي في المهمة المقيمة.

ولتمييز هذه الحالات، اقترحت الدراسة إضافة معدل فهم النية (Understanding Rate - UR) كمؤشر موازٍ. يتمحور هذا القياس حول تحديد ما إذا كانت الاستجابة تعكس المهمة المقيمة وتتعامل معها بالطريقة الصحيحة. في الواقع، تكشف هذه الرؤية المتكاملة عن اختلافات كبيرة حيث يمكن أن تشير قيم ASR المتشابهة إلى معدلات إنجاز مغايرة تمامًا.

عبر واجهات التحكم، بينت نتائج التجارب أن معدل الانجاز يتحسن بوضوح مع استخدام أوامر أكثر وضوحًا، بينما لا يتبع معدل نجاح الهجمات نفس النمط. كما أظهرت الدراسة أن حتى في الحالات ذات المعدلات المرتفعة للإنجاز، قد يستمر النموذج في تقديم مساعدات ضارة، مما يعكس حاجة ملحة لتبني طريقة شاملة لتقييم سلامة نماذج اللغة.

يمكن للباحثين والوكلاء المهتمين في هذا المجال الاطلاع على الكود وبيانات التجارب المتاحة على GitHub لمتابعة تطورات هذا المجال الحيوي.