تعتبر المحادثات التفاعلية عنصراً أساسياً في التواصل البشري، حيث تتأثر بشكل كبير بسياق الحوار وسلوك المستمع في اللحظات السابقة للكلام. في هذا السياق، نقدم لكم **ReACT-TTS**، وهو إطار عمل حديث يتكون من مرحلتين يستخدم تسلسلاً وجهياً مدته ثانية واحدة مستمد من ردود فعل المستمعين للتخطيط للعواطف ونغمة الحديث قبل البدء في الكلام.
في دراسة حديثة قام بها باحثون مختصون، تم تطبيق هذا الإطار على بروتوكول **MELD** (Multi-Emotion Recognition in Conversation) الصارم، حيث أظهرت النتائج تحسنًا كبيرًا في **المعدل العام للمقاييس المُشتركة** (mean macro-F1) والتوافق في تقييم المشاعر (VAD) مقارنةً بالطريقة التقليدية المعتمدة فقط على النص.
أشارت نتائج البحث إلى أن النمذجة الزمنية تتفوق على كل البدائل المرئية الأخرى، وأكدت أن الاختلاف الصريح بين ردود الفعل المبكرة والمتأخرة ليس ضروريًا لتحقيق أداء ممتاز. معظم القراء، بما يتجاوز 76% منهم، فضلوا الأسلوب الزمني، بينما انقسمت التفضيلات الأخرى بين النماذج النصية فقط.
بالإضافة إلى ذلك، تم الربط بين نمط الرد المتوقع ونموذج **Grad-TTS** لخلق تجربة استجابة متكاملة من اللحظة الأولى حتى التنفيذ النهائي للكلام. بفضل النتائج، أصبح من الواضح أن ديناميكيات ردود الفعل المسبقة للمستمعين تعتبر مؤشرات مكملة ضرورية في التخطيط للاستجابة الحوارية.
المصدر متاح على GitHub للباحثين والمطورين الراغبين في استكشاف هذا المجال المتطور.
استمع قبل أن تتحدث: كيف تخطط للردود اعتماداً على تعابير وجه المستمعين في توليد الكلام التفاعلي!
تقديم إطار العمل ReACT-TTS الذي يستخدم تسلسلاً وجهيًا للمستمعين لتخطيط العواطف والنغمات في الكلام قبل الحديث. تبرز النتائج أهمية ديناميكيات ردود الفعل المسبقة للمستمع في تحسين التخطيط الاستجابي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
