مع تقدم التقنيات المتعلقة بالصوت، أصبحت تقييمات جودة الصوت (Speech Quality Assessment - SQA) جزءًا أساسيًا من الاستراتيجيات الحديثة. يعتمد تقديرات سQA بشكل متزايد على نماذج الصوت الأساسية (Speech Foundation Models - SFMs). إن التحدي يكمن في تحديد أعمق طبقة تعتبر الأكثر فائدة للتنبؤ بالقيمة المتوسطة (Mean Opinion Score - MOS) وكيفية دمج المعلومات المختلفة من الطبقات المتعددة بشكل موثوق عبر مجموعة من البنى التحتية وبيانات المجموعات.
في دراسة حديثة، قمنا بإجراء اختبارات موسعة على عشرة SFMs مستخدمين أربع مجموعات بيانات MOS تحت ثلاث سيناريوهات: الضبط الكامل للنموذج، الاستفسار عن الطبقة الأخيرة مع مُشفّر مجمد، والتجميع العابر للطبقات باستخدام الأوزان.
أظهرت النتائج أن الطبقة الأمثل تعتمد بشكل كبير على نوع النموذج ومجموعة البيانات، وأن التجميع بالأوزان بشكل عابر يمكن أن يكون غير مستقر. لذلك، قمنا بتقييم نسخة معنية من التجميع المعاير لكل طبقة، والتي تطبق محولات خاصة قبل دمج الطبقات، مما يحسن من موثوقية التجميع متعدد الطبقات ويقلل الفجوة مقارنة بالضبط الكامل للنموذج مع إبقاء البنية التحتية مجمدة. لقد أثبت هذا الأسلوب كفاءته، مما يتيح لنا تحقيق نتائج متقدمة في تقييم جودة الصوت.
CAL-MOS: تطور ثوري في تقييم جودة الصوت باستخدام محولات للطبقات لتحسين دقة تقدير MOS!
تقييم جودة الصوت أصبح أكثر دقة مع تطوير CAL-MOS، الذي يعتمد على محولات لتحسين دمج المعلومات من طبقات متعددة في نماذج الصوت. هذه الدراسة تؤكد أهمية اختيار الطبقات المناسبة لكل نموذج وتجمع بيانات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
