شهدت نماذج الصوت الإشاري (Speech Foundation Models - SFMs) في الآونة الأخيرة تغييرات ثورية تتيح لها معالجة الصوت الخام مباشرة، مما يمكّن هذه النماذج من الاستجابة بشكل دقيق لتغيرات باراليغوية (paralinguistic) دقيقة. ومع ذلك، كيف تفهم هذه النماذج الإشارات غير اللفظية، لا يزال موضوعًا يحتاج إلى المزيد من الدراسة.

تحتوي الأبحاث الجديدة المقدمة مع VQ-Bench، وهي مجموعة تقييم محكمة تحتوي على مجموعة بيانات موازية تتضمن أنواع الأصوات مثل الصوت العادي، والصوت الخافت، والصوت المتهالك، ونهاية الصوت المتهالك. تم تقييم حساسية نماذج الصوت الإشاري من خلال توليد مفتوح عبر أربعة مجالات بيئية صالحة، بالإضافة إلى التعرف على عواطف الصوت.

كشفت النتائج عن فجوات في الأداء؛ حيث أثبتت إحدى واجهات البرمجة التجارية (API) الرائدة أنها لم تحقق معايير بيومترية أساسية، بينما أظهرت نماذج أخرى تحولات منهجية في الوكالة (agency)، والتعاطف، والقيادة، بناءً على نوع الصوت. وتعكس نتائج البحث التباينات بين الجنسين في الرواتب وتعزيزات القيادة، مما يدل على أن النماذج قد تعكس أو تضخم التحيزات الاجتماعية البشرية.

تضع هذه الدراسة إطارًا قابلاً للتكرار لضمان تفسير مسؤول للإشارات غير اللفظية في الذكاء الاصطناعي المبني على الصوت، مما يفتح المجال لدراسات مستقبلية تهدف إلى تحسين كيفية تعامل النماذج مع العواطف والإشارات غير اللغوية.