تعتبر الأصوات غير الكلامية (NVs) مثل الضحك والسعال والتنهيدات من العناصر الأساسية لتجربة تفاعلية ومعبرة عند استخدام أنظمة تحويل النص إلى كلام (TTS). ومع ذلك، لا تزال فعالية تحسين التفضيلات في توليد هذه الأصوات غير الكلامية غير مفهومة بشكل كامل.
تتناول الدراسة الحديثة هذه القضية بشكل شامل، حيث ركزت على دراسة تفضيلات مستخدمي الأصوات غير الكلامية، وبناء أزواج تفضيلية، وأهداف تحسين قائمة على أساليب نموذج التفضيل المباشر (DPO). من خلال تقديم معدل خطأ اصطناعي متعلق بالأصوات غير الكلامية (NV-CER)، وضعت الدراسة عملية تقييمية تعتمد على تصنيف الرموز الجديدة، مما يتيح تحسيناً قابل للتعديل لواقع الأصوات غير الكلامية دون تعديل الخوارزمية الأساسية.
أجريت تجارب باستخدام Emilia-NV وNV-Bench المحدثة، والتي تغطي 18 نوعاً من الأصوات غير الكلامية، وقد أظهرت كيف تؤثر خيارات التصميم المختلفة على إدراك هذه الأصوات وموثوقية الكلمات. كما وضعت الدراسة إعدادًا فعالًا باستخدام نموذج DPO القياسي.
وتتضمن التقييمات الموضوعية، القائمة على نماذج اللغات الكبرى (LLMs)، والتقييمات البشرية، أدلة متطابقة تدعم النتائج، مما يقدم نظرة شاملة حول تحسين ما بعد التدريب لتنظيم الأصوات غير الكلامية في أنظمة تحويل النص إلى كلام. هذه النتائج تسلط الضوء على كيفية إمكانية تحسين تجربة التواصل الإنساني من خلال استخدام تقنيات الذكاء الاصطناعي بشكل أكثر فعالية.
ثورة جديدة في تحسين تفضيلات توليد الأصوات غير الكلامية: كيف يمكن للذكاء الاصطناعي أن يعزز تجربة التواصل الإنساني؟
تتطرق الدراسة الحديثة إلى تحسين تفضيلات توليد الأصوات غير الكلامية (Non-Verbal Vocalizations) مثل الضحك والسعال. تسلط الضوء على فعالية تقنيات جديدة تهدف إلى تحسين التعبير في أنظمة تحويل النص إلى كلام (TTS).
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
