في سعيها نحو تحسين نمذجة الحوار الصوتي، قامت مجموعة من الباحثين بتطوير نموذج جديد يُعرف باسم DialectS2S، الذي يهدف إلى تلبية احتياجات اللهجات الصينية ذات الموارد المحدودة. يُعاني النماذج الحالية من صعوبة التعامل مع هذه اللهجات بسبب قلة البيانات الصوتية المتاحة، مما يؤثر سلباً على جودة الحوار.

يعمل النموذج DialectS2S بطريقة متكاملة، حيث يتم تطويرPipeline لتوليد الحوار الصوتي الخاص باللهجات، مما يتيح إنشاء بيانات تدريب بشكل أكثر كفاءة. أحد الابتكارات الرئيسية هو استراتيجية التدريب المتدرج على مرحلتين مع إشراف صوتي ذاتي التوافق، مما يضمن توافق المحتوى الدلالي للإشراف الصوتي مع التمثيلات الدلالية المتطورة للنموذج، مما يعزز جودة إنتاج الكلام باللهجات.

أظهرت النتائج التجريبية أن نموذج DialectS2S متفوق باستمرار على نماذج الأداء السابقة في العديد من اللهجات الصينية، حيث حقق تحسينات ملحوظة في اتساق اللهجة وجودة الردود وقابلية فهم الكلام. إن هذا الإنجاز يوفر حلاً فعّالاً وقابل للتوسع لنمذجة الحوار الصوتي في سيناريوهات اللهجات ذات الموارد المحدودة، مما يفتح آفاقاً جديدة للبحوث المستقبلية وتطبيقات عملية.

لتمكين الباحثين والمطورين في هذا المجال، تم فتح مصدر نموذج DialectS2S بالكامل، بما في ذلك نقاط التفتيش للنموذج ومجموعات بيانات التدريب وأكواد التخصيص.