في عالم الذكاء الاصطناعي، تعد تقييمات الأداء عنصراً حيوياً لفهم كيفية عمل نماذج اللغات الضخمة (Large Language Models). لكن كما كشفت دراسة جديدة، قد تكون الاعتماد على الاتفاق بين البشر وهذه النماذج غير موثوق به.

تمتد هذه الدراسة لتقييم أداء خمسة أنظمة LLM وثلاثة علماء بشريين على 2,560 رسالة تعليمية من منصة AI مخصصة للمدارس. حيث استخدمت مجموعة رموز هرمية تضم 72 رمزًا فرعيًا.

عند تقييم النتائج، تفاجأ الباحثون عندما وجدوا أن اتفاقية LLM مع البشر كانت أقل بكثير من الاتفاقية بين البشر بعضهم البعض، حيث سجلت متوسط اتفاقية Jaccard 0.30 مقارنة بـ 0.52 للبشر. ومع ذلك، عند استخدام خبراء مستقلين لتقييم النتائج بشكل أعمى، لم يجدوا فرقًا واضحًا بين نتائج البشر ونتائج LLM، حيث فضلوا كلا الجانبين بمعدلات متقاربة.

تظهر هذه الدراسة أن الاعتماد فقط على الاتفاقية كمعيار لتقييم أداء نماذج الذكاء الاصطناعي قد يكون غير كافٍ، ويدعو إلى نهج أعمق يتضمن تحليلًا شاملًا. لذا، هل حان الوقت لإعادة التفكير في كيفية تقييمنا للذكاء الاصطناعي؟

ما رأيكم في هذه النتائج؟ شاركونا آرائكم في التعليقات!