في عالم الذكاء الاصطناعي (AI)، تتزايد أهمية تقييم سلامة نماذج اللغات الضخمة (Large Language Models) مع ظهور أساليب اختراق جديدة تعكس توجهات غير مرغوب فيها. وقد أصبح تقييم مقاومة أساليب الاختراق (jailbreak) جزءاً مركزياً من هذا الجهد، إلا أن الأساليب السائدة حتى الآن تعتمد بشكل كبير على سلوك الرفض والتماثل الدلالي. لكن هل تعكس هذه الأساليب فعليًا مستوى الأمان المطلوب؟ ما يُظهره البحث الجديد هو أنه على الرغم من أن التحليل اللغوي قد يثير الفرضيات، إلا أنه يفشل في تقييم الصحة الحقيقية للردود.

لذلك، تم تطوير منهجية جديدة تُعرف باسم التحقق التسلسلي من الصحة على مستوى المعرفة والإجراء (SEAV). يقوم هذا الإطار بتفكيك الردود إلى خطوات مرتبة وتقييم كل من الصلاحية والصحة معًا. ويجمع SEAV بين آليات نماذج اللغات الضخمة كحكم لتفسير المعاني، مع تحقق معتمد على مصادر المعرفة الخارجية.

النتائج تجسد تحسينات هائلة، حيث أسهم SEAV في تقليل معدل الإيجابيات الزائفة بنسبة 14.9 نقطة مئوية مقارنة بأقوى الأدلة الحالية. والغريب أن 22.1% إلى 51.0% من النجاحات المُصنفة سابقًا تمت إعادة تصنيفها كغير صالحة عبر ثلاثة من أربعة مؤشرات عامة.

علاوة على ذلك، يؤكد هذا البحث على أن تعزيز الصحة يُشكل بشكل كبير مستوى الأمان المقاس، حيث يتم إعادة تصنيف العديد من النجاحات السابقة كمحاولات فاشلة. ولمن يسعى للاطلاع على الكود والبيانات، فهي متاحة على GitHub عبر الرابط https://github.com/Ardor-Wu/SEAV. لم يكن أمان أنظمتنا في الذكاء الاصطناعي أبدًا بهذا الأهمية، وأصبح من الضروري تبني الاتجاهات الجديدة مثل تلك التي يقدمها SEAV.