في عالم تكنولوجيا الذكاء الاصطناعي، يعتبر تقييم جودة الكلام أمرًا بالغ الأهمية، خاصةً مع تزايد استخدام أنظمة التواصل والصوت الاصطناعي. يعكس تقييم جودة الصوت التوافق مع انطباعات البشر، ومن هنا تأتي أهمية نموذج DAMOS الذي يعتمد على تحديد مواضع التشوهات بشكل دقيق.
يهدف تقييم جودة الكلام المتطور إلى توقع درجات الرضا (Mean Opinion Scores - MOS) بما يتوافق مع الإدراك البشري، وهو ما يعد أساسيًا في تقييم أنظمة توليد الصوت، وتحسينه، وأنظمة التواصل. غالبًا ما تتعرض الإشارات الصوتية، وبخاصة الصوت الاصطناعي، لتشوهات تحدث محليًا، مما يجعل الجودة الإدراكية تتأثر بمناطق معينة.
تواجه الطرق الحالية تحديًا، حيث تركز بشكل أساسي على MOS على مستوى الجمل، مما يوفر إشرافًا خشنًا للغاية دون ذكر مواقع التشوهات المحورية. لذلك، قام فريق البحث بإدخال مفهوم تحديد التشوهات كمعرفة مساعدة لتحسين تقييم جودة الصوت. حيث تم إنشاء أول مجموعة بيانات جزئية تحتوي على تشوهات صوتية مع توضيحات على مستوى الإطارات، وتدريب نموذج لتوليد إشارات التشوه.
من خلال الاستفادة من هذه الإشارات، تم تقديم DAMOS، وهو إطار عمل لتقييم جودة الكلام مع مراعاة التشوهات، يدمج معلومات التحديد في عملية توقع MOS. وقد أظهرت التجارب على عدة معايير عامة أن DAMOS يتفوق بانتظام على الطرق الموجودة، كما أنه يظهر تعميم قوي عبر مجموعات البيانات المختلفة، مما يثبت فعالية مفهوم تحديد التشوهات في تقييم جودة الصوت.
باختصار، يفتح نموذج DAMOS آفاقًا جديدة لكيفية تقييم جودة الصوت وتطبيقات الذكاء الاصطناعي، مما يدفع الحدود نحو تحسين التجربة السمعية.
DAMOS: ثورة في تقييم جودة الكلام باستخدام تحديد التشوهات بدقة!
DAMOS تتبنى مفهوم تحديد التشوهات لقياس جودة الصوت بشكل أكثر دقة، مما يعزز فهمنا للخطابات الاصطناعية. تكنولوجيا جديدة تعد بإحداث تغيير في كيفية تقييم جودة الصوت.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
