مع تقدم التقنيات المتعلقة بالصوت، أصبحت تقييمات جودة الصوت (Speech Quality Assessment - SQA) جزءًا أساسيًا من الاستراتيجيات الحديثة. يعتمد تقديرات سQA بشكل متزايد على نماذج الصوت الأساسية (Speech Foundation Models - SFMs). إن التحدي يكمن في تحديد أعمق طبقة تعتبر الأكثر فائدة للتنبؤ بالقيمة المتوسطة (Mean Opinion Score - MOS) وكيفية دمج المعلومات المختلفة من الطبقات المتعددة بشكل موثوق عبر مجموعة من البنى التحتية وبيانات المجموعات.

في دراسة حديثة، قمنا بإجراء اختبارات موسعة على عشرة SFMs مستخدمين أربع مجموعات بيانات MOS تحت ثلاث سيناريوهات: الضبط الكامل للنموذج، الاستفسار عن الطبقة الأخيرة مع مُشفّر مجمد، والتجميع العابر للطبقات باستخدام الأوزان.

أظهرت النتائج أن الطبقة الأمثل تعتمد بشكل كبير على نوع النموذج ومجموعة البيانات، وأن التجميع بالأوزان بشكل عابر يمكن أن يكون غير مستقر. لذلك، قمنا بتقييم نسخة معنية من التجميع المعاير لكل طبقة، والتي تطبق محولات خاصة قبل دمج الطبقات، مما يحسن من موثوقية التجميع متعدد الطبقات ويقلل الفجوة مقارنة بالضبط الكامل للنموذج مع إبقاء البنية التحتية مجمدة. لقد أثبت هذا الأسلوب كفاءته، مما يتيح لنا تحقيق نتائج متقدمة في تقييم جودة الصوت.