اعتبر أن تكون قادراً على فهم مشاعر الآخرين من خلال كلماتهم فقط! التعرف على عواطف الكلام (Speech Emotion Recognition - SER) ليس مجرد أداة تكنولوجية، بل هو عنصر أساسي يرتكز عليه العديد من التطبيقات التي تعنى بالإنسان، مثل الرعاية الصحية وخدمة العملاء. تتزايد في الآونة الأخيرة الاهتمام بالأطر التي لا تكتفي بتحقيق دقة عالية في التعرف على العواطف، بل تدعم أيضًا الشفافية في التنبؤات وسهولة النشر.

إحدى المشكلات التي قد تواجه الباحثين هي أن العديد من النماذج الحالية في خوارزميات التعرف على عواطف الكلام تعتمد على هياكل عميقة ومعقدة، مما يجعل من الصعب تفسير النتائج ويزيد من تكلفة الحوسبة. لهذا قدمت الورقة البحثية الجديدة نموذجًا خفيفًا وقابلًا للتفسير يعتمد على هيكل شبكة عصبية تلافيفية (Convolutional Neural Network) مدمجة.

تعتمد المنهجية المقترحة على تمثيلات لونية لمميزات الصوت اللوجارية (log-Mel spectrograms) لالتقاط الخصائص الزمانية والمكانية للكلام. كما تستخدم تجميع الإحصائيات الانتباهية لتسليط الضوء على المقاطع الزمنية التي تحمل عواطف بارزة.

لتحقيق المزيد من الشفافية في النموذج، تم دمج تقنية رسم التنشيط القائم على التدرجات (Gradient-based Class Activation Mapping - Grad-CAM) لتصور المناطق الزمنية والترددية التي تؤثر على توقعات النموذج. تظهر التجارب على مجموعة بيانات SAVEE للكلام العاطفي أن الإطار المقترح يحقق أداءً تنافسيًا في التعرف على العواطف في حين يحتفظ بهيكل خفيف مع عدد أقل بكثير من المعلمات مقارنة بالعديد من نماذج التعرف على عواطف الكلام الموجودة.

توضح النتائج أن الهياكل التلافيفية الفعالة المدموجة مع التحليل القابل للتفسير يمكن أن توفر توازنًا عمليًا بين دقة التعرف، وكفاءة الحوسبة، وشفافية النموذج. في عالم تتزايد فيه أهمية التواصل العاطفي، تمثل هذه الابتكارات فرصة مثيرة ومعززة لتجربة أي شخص مهتم بتقنيات الذكاء الاصطناعي.