مع تزايد استخدام نماذج اللغة الضخمة (Large Language Models) في مجال التعليم كمساعدين تعليميين ومدرسين، تبرز أهمية تطوير معايير قادرة على تقييم كفاءتها في دورها العملي. ومن هنا، تم تقديم معيار ELBench، والذي يتميز بكونه الأول من نوعه في تقييم أربعة جوانب رئيسية للنماذج: القدرة العامة، الأمان والثقة، التعليم الأساسي، والتطوير العالي المستوى.

تتناول التقييمات الحالية هذه الجوانب بشكل متفرق، مما يضعنا أمام تحدٍ كبير للعثور على نموذج تعليمي متكامل. إليكم أبرز النتائج التي تم التوصل إليها من خلال تطبيق معيار ELBench على تسعة نماذج مختلفة: سبعة منها أنظمة عامة رائدة واثنان متخصصان في التعليم.

أولاً، اتضح أن الملفات التعريفية لكل نموذج توفر معلومات أكثر دقة من التقييم الإجمالي. فعلى الرغم من أن النماذج الستة الأولى لم تختلف إحصائياً في درجاتها العامة، إلا أن القادة في كل منطقة تختلف بشكل ملحوظ. ثانياً، أظهرت النماذج المطورة في الصين تفوقًا ملحوظًا في معيار الأمان، وذلك وفقًا لمحتوى معايير الإقليم، بينما كان الفارق أقل عند تقييم المحتوى العالمي. ثالثًا، الفجوة البارزة كانت في فشل النماذج المتخصصة في التعليم في تحقيق أي تقدم ملحوظ في مجالات التعليم والتطوير العالي، مما يثير تساؤلات حول فعالية التدريب ما بعد النموذج في المجالات التعليمية.

بهذا، يفتح معيار ELBench آفاقاً جديدة لفهم أداء نماذج اللغة في التعليم، كما يعزز الحاجة لمزيد من الدراسات لتحديد ما إذا كانت هذه النماذج قادرة على تلبية متطلبات التعليم بكفاءة عالية.