في عالم الذكاء الاصطناعي، تلعب نماذج اللغة الصوتية الكبيرة (Large Audio Language Models - LALMs) دورًا أساسيًا في تقديم أداء متميز في معالجة مهام الصوت المتنوعة. في هذا الإطار، تم إطلاق وحدة تشفير الصوت الموحدة UniAE-MoE، التي تم تصميمها خصيصًا لتطوير تمثيلات الصوت عبر مجالات متعددة.

تستخدم UniAE-MoE بنية مزيج الخبراء (Mixture-of-Experts), مما يمكنها من تحسين الأداء في مجموعة واسعة من المهام. تتضمن هذه الوحدة دمج عدة مشفرات صوتية متميزة، مثل Qwen2-Audio وAudio-Flamingo 3، والتي أثبتت قدراتها الممتازة في الأداء اللاحق.

علاوة على ذلك، تم تعزيز أداء UniAE-MoE باستخدام تقنية SwiGLU مع خبراء مشتركين لتقليل تعقيد الشبكات المشفرة. ولتلبية احتياجات المهام المتنوعة، تم إدخال استراتيجية تحسين تعليمي على مرحلتين لتحقيق تكيّف أفضل للموديل مع مجموعة من المهمات.

وتشمل الابتكارات الأخرى تقنية قياس البيانات المحددة للمهمة (Task-Specific Data Scaling - TSDS) التي تهدف إلى تعزيز قدرات فهم النموذج للصوت. في تقييم XARES-LLM، سجلت UniAE-MoE 0.802، مما يضعها في مرتبة عالية بين النماذج المتقدمة.

وفوق ذلك، أثبتت UniAE-MoE كفاءتها العالية في تحدي قدرات مشفر الصوت الرسمي Interspeech 2026، مما يدل على قدرتها الكبيرة على التعميم عبر مختلف المهام الصوتية. إن النتائج التي تحققت تعكس فعالية هذا النموذج في تقديم فهم متكامل للصوت، سواء كان في الكلام أو الموسيقى أو الأصوات العامة.