في عالم تقنيات الذكاء الاصطناعي، يعتبر الفهم الصوتي من أبرز التطورات الحديثة، حيث حققت نماذج اللغة الكبيرة لفهم الصوت (Large Audio Language Models) تقدمًا لافتًا. لكن حتى الآن، كانت تقييمات هذه النماذج محدودة في نطاق اللغة الإنجليزية وفي مجالات صوتيّة ضيّقة. ومن هنا، تأتي أهمية الأبحاث الجديدة التي تركز على فهم الصوت في سياقات متعددة.

اليوم، نقدم لكم EXAM²، المرجع الثوري لفهم الصوت المتعدد اللغات والأنماط. هذا المعلم البحثي الجديد يتضمن ست لغات ويغطي مجالات صوتية مختلفة مثل الكلام، الأصوات، والموسيقى، بالإضافة إلى إعدادات الصوت المختلط والصور المرئية. من خلال دمج المعلومات البصرية مع المدخلات الصوتية المتنوعة، يوفر EXAM² تقييمًا أكثر واقعية لفهم المشهد الصوتي والتفكير عبر الأنماط.

يتضمن EXAM² أكثر من 5600 سؤال اختيار متعدد، و22614 حالة صورة، و135684 ترجمة متعددة اللغات. وقد تم تقييم أحدث نماذج اللغة الكبيرة المفتوحة والملكية في هذا المجال، مما أظهر الفجوات الكبيرة في الأداء في الفهم المتعدد اللغات والفهم عبر الأنماط.

ولمزيد من التحسين، تم تقديم نموذج Gemma3n-EXAM²، وهو نموذج دمج خفيف الوزن تم تدريبه على مجموعة بيانات EXAM²، حيث حقق تحسينات تصل إلى 12.4% في السياقات متعددة اللغات و21.7% في التقييم عبر الأنماط مقارنةً بنموذج أساسي قوي. تُصنف هذه النتائج كخطوة أولى نحو مستقبل واعد للبحث في الذكاء الاصطناعي لفهم الصوت المتعدد اللغات والأنماط.