في عالم الذكاء الاصطناعي، تم تصميم نماذج اللغة الصوتية (Audio Language Models) لفهم الكلام، لكن هل تدرك فعلاً كيف يُقال الشيء، بجانب ما يُقال؟ في هذا المقال، نستعرض دراسة عميقة توضح تحليلًا آليًا للمعلومات البيرالغة (Paralinguistic Information) عبر أربعة نماذج مفتوحة المصدر، وهي Whisper-large-v2 وQwen2-Audio-7B Instruct وQwen2.5-Omni-7B وChroma-4B.
استخدمت الدراسة مجموعة بيانات Expresso، التي تحتوي على أنماط كلام متحكم بها، لكشف مدى انتقال المعلومات من معالج الصوت إلى المخرجات النهائية للنماذج. من خلال تقنيات مثل محاذاة النواة المركزية (Centered Kernel Alignment) والاختبار التفاضلي (Leave-One-Speaker-Out Evaluation) وتوقع النغمة المفتوحة، تلخصت النتائج في نقاط رئيسية.
تشير النتائج إلى أن جميع النماذج تصنع إشارة قوية لنمط الحديث (Speaking Style) في الأجزاء الأخيرة من معالج الصوت، يحدد ذلك الجزء العلوي من الطبقات. إلا أن هذه المعلومات تتعرض للتدهور قبل الوصول إلى المخرجات النهائية.
تتعامل النماذج بشكل مختلف؛ فبعضها يعتمد على المحتوى (Content-Driven)، حيث تتوقف التوقعات على النصوص، بينما أخرى تُظهر سلوكًا يعتمد على الأصوات (Acoustic-Driven)، مما يعني أن التوقعات تتأثر بنمط الحديث. يُظهر مقياس التسرب (Leakage Metric) هذا الاختلاف بوضوح، حيث تؤكد النتائج الكيفية الحاجة إلى فهم أعمق لما تسجله النماذج مقارنة بما تستخدمه.
في النهاية، يلقي هذا التحليل الضوء على فجوة محورية بين ما تستطيع النماذج احتوائه وما تجري تصفيته، مما يبرز تقييدات رئيسية في نماذج اللغة الصوتية الحالية.
هل تفهم نماذج اللغة الصوتية المعنى الخارجي للكلمات؟ تحليل مثير للمعلومات البيراللغة!
تكشف دراسة جديدة عن تباين بين ما تفهمه نماذج اللغة الصوتية وما تستخدمه في توقعاتها. سلطت الأضواء على قيود المعلومات البيرالغة في أربعة نماذج صوتية شهيرة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
