في عالم الذكاء الاصطناعي، يمثل فهم المشاعر عبر الوسائط المتعددة (Multimodal Emotion Recognition) أحد أبرز المجالات البحثية في الحوسبة العاطفية (Affective Computing). حيث تلعب هذه التقنية دورًا محوريًا في تطبيقات واسعة، تشمل تحليل العواطف (Sentiment Analysis) وخدمة العملاء الذكية (Intelligent Customer Service) والتفاعل بين الإنسان والكمبيوتر (Human-Computer Interaction).

ومع ذلك، تعاني الأساليب الحالية من الاعتماد على ميزات أحادية الوسائط (Single-modal Features) أو دمج بسيط للمعلومات (Simple Multimodal Fusion)، مما يحدّ من قدرتها على التقاط التفاعل بين السياقات العامة والمحلية، وهو ما يؤثر سلبًا على أداء النماذج وفهم المشاعر.

ردًا على هذه التحديات، تم اقتراح نموذج جديد يُعرف باسم Transformer-GAT، وهو إطار هجين يجمع بين تقنيتي Transformer والشبكة الانتباهية البيانية (Graph Attention Network) لتعزيز فهم المشاعر عبر الوسائط المتعددة.

يستخدم نموذج Transformer لالتقاط المعلومات الدلالية العامة، بينما تستفيد الشبكة الانتباهية البيانية من تقديم العلاقات الدقيقة بين الوسائط المختلفة، مما يحسن من تمثيل الميزات العاطفية.

أظهرت التجارب التي أجريت على مجموعتي بيانات IEMOCAP وMELD أن نموذجنا الجديد حقق نتائج متميزة، حيث سجلت نقاط F1 الموزونة 72.45% و77.37% على التوالي، متفوقًا بذلك على العديد من الأساليب المتقدمة.

تشير هذه النتائج إلى أن Transformer-GAT يدمج بفعالية الميزات متعددة الوسائط ويوفر توازنًا بين السياقات العامة والمحلية، مما يوفر رؤى أعمق في العالم العاطفي. وهذا يفتح آفاق جديدة نحو تحسين الحوسبة العاطفية متعددة الوسائط، مما يعد بتطورات مثيرة في مجال الذكاء الاصطناعي.