في ظل التقدم السريع الذي يشهده الذكاء الاصطناعي، يعد التقييم الآلي لتوليد الوسائط المتعددة (Multimodal Generation) أحد أكبر التحديات التي تواجه الباحثين. فالأدوات المتاحة غالبًا ما تفشل في محاكاة تقييم البشر، خصوصًا في المهام المعقدة التي تجمع بين وسائط متعددة كالصورة والصوت والنصوص.

اليوم، نقدم لكم اختراعًا جديدًا يغير قواعد اللعبة: معيار MMMG (Multimodal Multitask Generation Benchmark). هذا المعيار يعد الأول من نوعه الذي يطبق نموذج التحقق القابل للاختبار على توليد الوسائط المتعددة، حيث يشمل أربع مجموعات من الوسائط: الصور، الصوت، النصوص والصور المتداخلة، والنصوص والصوت المتداخل.

يميز MMMG نفسه عن معايير التقييم الأخرى من خلال تركيزه على المهام القابلة للتحقق أو القريبة من ذلك، مما يضمن تقييمًا أكثر دقة وكفاءة. يتضمن هذا المعيار 55 مهمة، بما في ذلك 31 مهمة جديدة تم تصميمها بعناية، بالإضافة إلى 1288 تعليمات مصممة بشكل منهجي لقياس قدرات التفكير والتحكم وغيرها من المواهب الأساسية لنماذج توليد الوسائط المتعددة.

أظهرت التحقق الواسع أن MMMG يتوافق بشدة مع حكم البشر، حيث حقق متوسط توافق بنسبة 94.4%. ولكن ما يلفت الانتباه هو نتائج الاختبارات على 29 نموذجًا، حيث حقق النموذج الرائد، GPT Image، دقة تصل إلى 70.7% في توليد الصور، لكنه لم يكن بنفس النجاح في الجيل المتداخل.

تشير النتائج إلى وجود فضاء كبير للتحسين في توليد الصوت، وهو ما يُعد اتجاهًا مستقبليًا هامًا. نحن على أعتاب تطوير التقنيات، فما هي أفكارك حول هذه المعايير الجديدة؟