في عالم الذكاء الاصطناعي الفيزيائي، تظل النماذج متعددة وقياسات التقييم متباينة. لكن دراسة جديدة تناولت بإمعان المعايير المستخدمة لتلك النماذج، وخرجت بنتائج مثيرة. حيث قام الباحثون ببناء مصفوفة تضم 51 نموذجاً على 12 معياراً فيزيائياً تم اختيارها من سجل يضم 51 معياراً و152 نموذجاً، مستخدمين كثافة الإبلاغ لترتيب تلك النماذج.

وتظهر النتائج وجود تكرارية كبيرة تؤثر على التصنيفات المعلنة لهذه النماذج. على سبيل المثال، تجمع الدراسات بين أزواج بديلة من المعايير، مما يؤدي إلى تغيير مكانة 22 نموذجاً بواقع ثلاث مراتب أو أكثر في المتوسط.

عبر تحديد معايير اختبار بناءً على تشتت النتائج، تمكن الباحثون من تصنيف أربعة معايير رئيسية تحتفظ بنسبة 78.5% من فائدة جميع المعايير الاثني عشر، وتعديل التصنيف باستخدام طريقة "برادلي-تيري" (Bradley–Terry). يجدر بالذكر أن هذه الطريقة ليست خاصة بمجال الذكاء الاصطناعي الفيزيائي فقط، ولكن يمكن تطبيقها في مجالات أخرى.

تفتح هذه النتائج آفاقاً جديدة لفهم كيفية تحسين تقييم النماذج في مجال الذكاء الاصطناعي. فهل يمكن أن تسهم هذه الدراسة في إعادة صياغة طرق التقييم المستخدمة حالياً؟ ما رأيكم في هذه النتائج؟ شاركونا في التعليقات!