تشهد النماذج الكبيرة لفهم الصور (Large Vision-Language Models) تقدماً ملحوظاً في فهم المعلومات المتعددة الوسائط. ومع ذلك، لا يزال تقييم قدراتها في السياقات التعليمية ناقصاً. في عالم التعلم اللغوي المدعوم بالذكاء الاصطناعي، يتطلب الأمر من النماذج فهم الصور الفنية، والتفاعل مع محتواها الدلالي والعاطفي والثقافي، وتبرير السياق البصري من أجل دعم التفاعل الفعّال.

للأسف، تركز المعايير الحالية بشكل أساسي على الصور الواقعية أو التفكير التعليمي الخاص بمجالات معينة، مما يقدم تغطية محدودة للمحتوى الفني التعليمي. لذا، جاء مؤشر MUSE ليملأ هذه الفجوة من خلال توفير معيار لتقييم النماذج الكبيرة لفهم الصور الفنية في التطبيقات التعليمية.

يميز مؤشر MUSE بين عملية تخصيص الصورة وتوليد الأسئلة، مما يسمح بتنفيذ مهام متنوعة بمستويات صعوبة قابلة للتحكم، مما يقلل من جهد التخصيص. يتكون من اثني عشر مهمة تشمل الإدراك البصري، والتفسير الدلالي والعاطفي، وفهم الثقافة، والتفكير التركيبي.

يتضمن المؤشر مجموعة فنية متنوعة مُعَدّة بعناية لتعكس الجوانب الثقافية المتعددة في سنغافورة وجنوب شرق آسيا، بجانب التقاليد الفنية الغربية، حيث تغطي مجموعة متنوعة من المواضيع ومستويات الصعوبة. تكشف نتائج تقييم النماذج مفتوحة المصدر والخاصة عن فوارق كبيرة عبر أبعاد القدرات، خصوصاً في مجالات التفسير العاطفي والتفكير التركيبي. كما حدد تحليلنا أنماط فشل شائعة وتحديات رئيسية لتطوير نماذج متعددة الوسائط جديرة بالثقة في التعليم.

نأمل أن يصبح مؤشر MUSE معياراً موحداً يساهم في تعزيز الفهم متعدد الوسائط في التطبيقات التعليمية.