تُعتبر فكرة التعرف على العواطف أثناء الحوار من الموضوعات التي حظيت بدراسات واسعة، إلا أن تطبيق نماذج اللغة الكبيرة (LLMs) في تقييم العواطف المستمر داخل حوارات متعددة الوسائط لا يزال غير مستكشَف بشكل كافٍ. في هذا الاتجاه، قمنا بتطوير إطار عمل يستند إلى نماذج اللغة الكبيرة (LLMs) يقوم على التعرف على العواطف بشكل متقطع وتقييم الأبعاد العاطفية (Valence-Arousal-Dominance) في بيانات IEMOCAP.
يستخدم هذا الإطار الإشارات الصوتية كأوصاف لغوية طبيعية تتبع نهج SpeechCueLLM، حيث أجرينا تقييمًا لستة نماذج تُغطي عائلات LLaMA و GPT و Qwen، مع استخدام أساليب الإدخال المختلفة مثل zero-shot و few-shot، بالإضافة إلى تحسين LoRA.
أظهرت نتائجنا أن نماذج LLaMA المُحسَّنة باستخدام LoRA تتفوق بشكل ملحوظ على نماذج GPT المُصممة بطريقة ذكية، رغم أن الأخيرة تتمتع بنطاق أكبر. نعتقد أن الفجوة في الأداء تعود إلى التكيف مع المجال بدلاً من سعة النموذج.
قدّم أفضل نموذج لدينا تقييم Valence CCC يصل إلى 0.7822، وهو أفضل أداء مسجل حتى الآن على مجموعة بيانات IEMOCAP. وقد أكدت الدراسات التحليلية أن وجود أوصاف صوتية نصية يُحسن من أداء النماذج الأصغر (+3.5 إلى 3.6 في درجات F1 الموزونة)، بينما ساهمت قليلاً للنموذج الأكبر، مما يدل على أن الإشارات الصوتية تكون أكثر قيمة عندما تكون القدرة اللغوية محدودة.
تظهر عدم التماثل في الأداء عبر أبعاد VAD بشكل متقارب توافق التصنيف بين المحللين في بيانات IEMOCAP.
ثورة في فهم العواطف: تقييم الأبعاد العاطفية باستخدام نماذج اللغة الكبيرة!
تُعد تقنيات التعرف على العواطف في الحوار مجالًا مهمًا، ومع ذلك، لم يتم حتى الآن استكشاف تطبيق نماذج اللغة الكبيرة (LLMs) في تقييم العواطف المستمرة. تعرفوا على كيفية استخدام هذه النماذج لتحسين دقة التعرف على العواطف في المحادثات المتعددة الوسائط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
