تُعتبر تقنية المحاذاة الصوتية القسرية (Phonetic Forced Alignment) أداوات أساسية في مجال البحث الفونتي، لكن العوائق تتزايد عندما يتعلق الأمر باللغات ذات الموارد المنخفضة. من هنا، جاء هذا البحث ليُحدث ثورة في كيفية تعاملنا مع هذه اللغات، حيث تم التركيز بشكل خاص على لهجة ماندرين تشنغدو.
تمت تجربة نماذج جديدة، بما في ذلك نموذج GMM-HMM الخاص بالمحاذاة النصية المعتمدة (Chengdu-MFA)، الذي تم تدريبه باستخدام مجموعة بيانات تحتوي على 17 ساعة من التسجيلات الصوتية ومُعجم G2P مخصص. كما تم تحسين مُشفِّر الصوت المدرب مسبقًا ليكون قادرًا على التصنيف الإطاري من خلال استخدام تسميات شبه للمحاذاة النصية غير المعتمدة (Chengdu-FC).
أظهرت التقييمات على مجموعة اختبار تم تصنيفها بواسطة خبراء، أن كلا الطريقتين تفوقتا بشكل ملحوظ على النماذج المعتمدة على ماندرين القياسي. حيث تقلصت الفروقات في متوسط حدود الهاتف بنسبة تصل إلى 31.8% باستخدام Chengdu-MFA، بينما سجل Chengdu-FC نسبة تقليص مذهلة بلغت 61.2%
هذه التطورات تمثل خطوة هامة نحو إنشاء خطوط اتصال أكثر دقة وتخصصًا للدوال البحثية في اللغات ذات الموارد المنخفضة، مما يؤكد أنه يمكن تطوير أنظمة عالية الجودة دون الحاجة لتسميات يدوية مكلفة من حيث الجهد والوقت.
تحقيق إنجاز ثوري: تقنية المحاذاة الصوتية للغات ذات الموارد المنخفضة في ماندرين تشنغدو!
تسجل تقنية المحاذاة الصوتية تقدمًا كبيرًا في دعم لغات الموارد المنخفضة، حيث طُوِّر نموذج خاص للغة ماندرين تشنغدو. النتائج تشير إلى تحسين ملحوظ في دقة المحاذاة مقارنةً بالنماذج التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
