تبعاً لدراسة جديدة نُشرت على منصة arXiv، إن تقييمات سلامة نماذج اللغات الكبيرة (LLMs) تعتمد غالبًا على نصوص تحدي معتمدة، مما قد يفوت الفرص للكشف عن الثغرات المحتملة الناتجة عن استخدام مدخلات بديلة. قامت الدراسة بفحص الرموز التعبيرية كحالة اختبار لهذه الثغرات، حيث تم تقييم 50 موجهًا باستخدام أربع نماذج مفتوحة المصدر: Mistral 7B، Qwen 2 7B، Gemma 2 9B، وLlama 3 8B.

أظهرت النتائج تباينًا كبيرًا في متانة الأداء: فبينما سجلت نماذج Gemma 2 9B وMistral 7B معدلات نجاح متفاوتة تصل إلى 10%، كانت نسبة نجاح Llama 3 8B 6%، بينما أبدت Qwen 2 7B مقاومة كاملة بنسبة 0%.

استخدم الباحثون اختبار كاي المربع ($\chi^2 = 32.94, p < 0.001$) لتأكيد الفروق الصحية في توزيع النتائج، مما يشير إلى أن متانة هذه النماذج حساسة لنوع المدخلات المستخدمة، وأن التقييمات المحدودة على موجهات نصية تقليدية قد تسيء تمثيل الثغرات المحتملة للنماذج.

يجب أن تدفع هذه النتائج الباحثين نحو التفكير في دمج أنواع جديدة من المدخلات، مثل الرموز التعبيرية، في تقييمات السلامة لضمان تطوير نماذج أكثر أمانًا وموثوقية. فهل ستؤثر هذه النتائج على كيفية تقييم نماذج الذكاء الاصطناعي في المستقبل؟