في عالم الذكاء الاصطناعي، تتسارع الابتكارات بوتيرة مذهلة، وخاصة في مجال نماذج اللغات الكبيرة (Large Language Models). وقد أدت التطورات الأخيرة إلى ظهور نماذج متعددة الوسائط (Multimodal LLMs)، والتي تجمع بين النصوص والكلام والرؤية في إطار واحد. ومع تطور هذه النماذج نحو القدرة على اتباع التعليمات عبر مهام متنوعة ومعقدة، بات من الضروري تقييم قدراتها عبر اللغات والوسائط المختلفة، سواء في النصوص القصيرة أو الطويلة.

لكن، ماذا تعني هذه التحديات بالنسبة للأبحاث الحالية؟ للأسف، المؤشرات المتاحة لم تكن كافية في تقييم هذه الأبعاد بشكل مشترك، إذ إنها غالبًا ما تكون محدودة باللغة الإنجليزية، تركز على وسائط واحدة في كل مرة، تعتمد على مدخلات قصيرة، أو تفتقر إلى التقييمات البشرية، مما يعيق القدرة على تقييم أداء النماذج عبر اللغات والوسائط وتعقيد المهام.

لحل هذه المشكلة، تم تقديم مؤشر MCIF (Multimodal Crosslingual Instruction Following)، والذي يمثل الأول من نوعه ويعتمد على تقييمات بشرية. هذا المؤشر يستند إلى محادثات علمية تتعلق بمعالجة اللغة الطبيعية (NLP) وما بعدها، ويركز على تقييم الأداء في إعدادات متعددة الوسائط ومتعددة اللغات.

يتضمن مؤشر MCIF أربعة مهام رئيسية: التعرف والترجمة، والإجابة على الأسئلة، والتلخيص، كما يغطي ثلاث وسائط أساسية (الكلام والرؤية والنصوص) وأربع لغات متنوعة (الإنجليزية، الألمانية، الإيطالية، والصينية)، مما يتيح تقييمًا منهجيًا لقدرات نماذج الذكاء الاصطناعي في تفسير التعليمات عبر اللغات المختلفة ودمج المعلومات السياقية المتعددة الوسائط بشكل فعال.

تشير نتائج تحليلنا لعدد 23 نموذجًا إلى وجود تحديات عالمية تواجه النماذج عبر الوسائط والمهام، مما يدل على وجود مساحة كبيرة للتحسين في تطوير نماذج الذكاء الاصطناعي المستقبلية. ولتشجيع البحث المفتوح، تم إصدار مؤشر MCIF تحت ترخيص CC-BY 4.0، مما يسهل الوصول للباحثين والمطورين لتحسين استراتيجيات التعلم الآلي.

ما رأيكم في هذا التطور الثوري في عالم الذكاء الاصطناعي؟ هل تعتقدون أن هذا المؤشر سيساهم في تحسين الأداء عبر اللغات المتعددة؟ شاركونا آراءكم في التعليقات!