لا يزال العالم التكنولوجي يشهد تقدمًا مذهلاً في مجال نماذج اللغة الخطابية (Speech Language Models - SLMs)، خاصة في البيئات التي تضم العديد من المتحدثين. ومع ذلك، كانت قدرات هذه الأنظمة في نسب الكلام إلى المتحدث الصحيح واستدلال الهويات المتحدثة غير واضحة بعض الشيء.

لذلك، قدم فريق من الباحثين نموذج HEAR، وهو معيار هرموني مبتكر يشخص القدرات الأساسية لاستدلال المتحدثين. يتكون هذا النموذج من 2.4 ألف عينة تم التحقق منها بشريًا من 887 مقطع صوتي متنوع.

لكن نتائج تقييم 20 نموذجًا رائدًا من نماذج اللغة الخطابية على معيار HEAR أظهرت أن هذه النماذج تواجه صعوبات كبيرة في هذه المهام الأساسية، حيث غالبًا ما تعتمد على البديهيات الدلالية بدلاً من علامات الصوت الفعلية.

لمعالجة هذه المشكلة، تم تقديم نموذج A2R، وهو نموذج يحتوي على 30 مليار متغير، تم تحسينه باستخدام مجموعة بيانات Counterfactual Audio with Speaker-level Hard negatives (CASH). هذه المجموعة مصممة لإرشاد النموذج لإعطاء الأولوية للإشارات الصوتية بدلاً من الإشارات اللغوية.

حقق A2R أداءً قويًا على معيار HEAR وأظهر قدرة على التعلم من دون إشراف للأداء القوي في المهام المتعددة للمتحدثين، مما يدل على أن تعلم نسب المتحدثين يفتح إمكانيات جديدة للنماذج لفهم استدلال المتحدث.

كل الموارد المتاحة لمزيد من الاستكشاف يمكن أن تُجد في رابط المشروع. ما رأيكم في هذا التطور الثوري في تقنية الذكاء الاصطناعي؟ شاركونا في التعليقات!