في عالم يزداد فيه الاعتماد على الذكاء الاصطناعي (AI)، أصبح التعرف على العواطف في الصوت (Speech Emotion Recognition - SER) أحد المفاتيح الأساسية لتحسين تفاعل الإنسان مع الآلات (Human-Computer Interaction - HCI). يسعدنا أن نقدم لكم تقنية جديدة تُعرف بنموذج DCRF-BiLSTM، الذي أثبت جدارته في التعرف على سبعة عواطف رئيسية: حيادي، سعيد، حزين، غاضب، خائف، اشمئزاز، ومفاجأة.
تم تدريب النموذج على خمس مجموعات بيانات رئيسية، وهي RAVDESS، TESS، SAVEE، EmoDB، وCrema-D. وقد حقق نتائج رائعة، إذ سجل دقة تصل إلى 97.83% على مجموعة RAVDESS، و97.02% على SAVEE، و95.10% على Crema-D، بالإضافة إلى 100% على كل من TESS وEmoDB.
وعند دمج بيانات RAVDESS وTESS وSAVEE، حقق النموذج دقة مذهلة تبلغ 98.82%، متفوقاً بذلك على النتائج السابقة المُبلّغ عنها. ومن الملاحظ أن هذه الدراسة تمثل خطوة فريدة من نوعها، حيث أنها قدّمت نموذج SER واحد لتقييم جميع المجموعات الخمس للبيانات بشكل متزامن.
بهذه الطريقة، أثبت نموذج DCRF-BiLSTM قوته وقدرته على التعميم عبر مجموعات بيانات متنوعة، على الرغم من التحديات المختلفة التي تواجهها.
إذاً، كيف يمكن أن تؤثر هذه التقنية الجديدة على مستقبل الذكاء الاصطناعي وتفاعله مع البشر؟ شاركونا آرائكم في التعليقات!
تقنية جديدة لعمق التعلم للكشف عن العواطف في الصوت: مستقبل تفاعلي واعد!
تكشف دراسة حديثة عن نموذج مبتكر يستخدم التعلم العميق للكشف عن العواطف في الصوت بدقة عالية. يتضمن النموذج التعرف على سبعة عواطف ويحقق نتائج استثنائية عبر عدة مجموعات بيانات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
