في عالم الذكاء الاصطناعي، تعد تقييمات الأداء عنصراً حيوياً لفهم كيفية عمل نماذج اللغات الضخمة (Large Language Models). لكن كما كشفت دراسة جديدة، قد تكون الاعتماد على الاتفاق بين البشر وهذه النماذج غير موثوق به.
تمتد هذه الدراسة لتقييم أداء خمسة أنظمة LLM وثلاثة علماء بشريين على 2,560 رسالة تعليمية من منصة AI مخصصة للمدارس. حيث استخدمت مجموعة رموز هرمية تضم 72 رمزًا فرعيًا.
عند تقييم النتائج، تفاجأ الباحثون عندما وجدوا أن اتفاقية LLM مع البشر كانت أقل بكثير من الاتفاقية بين البشر بعضهم البعض، حيث سجلت متوسط اتفاقية Jaccard 0.30 مقارنة بـ 0.52 للبشر. ومع ذلك، عند استخدام خبراء مستقلين لتقييم النتائج بشكل أعمى، لم يجدوا فرقًا واضحًا بين نتائج البشر ونتائج LLM، حيث فضلوا كلا الجانبين بمعدلات متقاربة.
تظهر هذه الدراسة أن الاعتماد فقط على الاتفاقية كمعيار لتقييم أداء نماذج الذكاء الاصطناعي قد يكون غير كافٍ، ويدعو إلى نهج أعمق يتضمن تحليلًا شاملًا. لذا، هل حان الوقت لإعادة التفكير في كيفية تقييمنا للذكاء الاصطناعي؟
ما رأيكم في هذه النتائج؟ شاركونا آرائكم في التعليقات!
التقييمات المتحيزة: دراسة تكشف عيوب الاعتماد على الاتفاق في تكنولوجيا الذكاء الاصطناعي!
كشفت دراسة جديدة أن الاعتماد على تقييمات الاتفاق بين البشر وأنظمة الذكاء الاصطناعي (LLMs) قد يكون مضللاً. النتائج تظهر أن التقييمات يمكن أن تخفي عيوبًا جدية في الفهم والتحليل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
