في عالم الذكاء الاصطناعي، أثبتت قدرة نماذج اللغة المتعددة الوسائط (Multimodal Large Language Models) على إحداث تحول في كيفية فهمنا للعواطف. ولكن، حتى الآن، كانت هذه النماذج تقتصر على معالجة مقاطع الفيديو القصيرة، مما يجعلها تواجه تحديات كبيرة في فهم العواطف المعقدة في المقاطع الطويلة. من هنا، تأتي مبادرة جديدة تحت مسمى LongEmo، الهادفة إلى معالجة هذه الفجوة.

يعتبر LongEmoBench معياراً مبتكرًا يركز على فهم العواطف والعقلانية في الفيديوهات الطويلة. فهو يقيس قدرات العملية التطورية بدءًا من التفاعلات المستمرة للمشاهد إلى أحداث مؤقتة معقدة.

من خلال نموذج LongEmo، الذي يُعتبر إطاراً جديداً يعتمد على الذاكرة المعززة، يتمكن من معالجة تدفقات الفيديو المستمرة وإنشاء رسم بياني للذاكرة المتعلقة بالأحداث (Event Memory Graph). هذا النموذج مصمم لتصوير الاعتماديات طويلة المدى والتقاط الديناميكيات العاطفية عبر الأحداث المتميزة.

عندما يُطرح سؤال، يقوم LongEmo باسترجاع تدفق الأحداث المناسب من الرسم البياني ويقوم بدمج الذكريات المتعددة الوسائط والاعتماديات العلائقية من أجل استنتاج الإجابة النهائية. وقد أظهرت التقييمات الشاملة لسبعة عشر نموذجاً تمثيليًا أنهم يواجهون صعوبات كبيرة في فهم العواطف والعقلانية في الفيديوهات الطويلة، بينما نجح LongEmo في تحقيق أداء رائد، مما يثبت فعالية معماريته الموجهة نحو الأحداث.

إن نجاح LongEmo في معالجة العواطف في الفيديوهات الطويلة يمثل خطوة كبيرة نحو تحسين تقنيات الذكاء الاصطناعي، وفهم أعمق للعواطف البشرية. فما رأيكم في هذا التطور؟ شاركونا في التعليقات.