شهدت نماذج اللغات الضخمة للفيديو (Video Large Language Models) في الآونة الأخيرة نتائج قوية، ولكن التقييم الدقيق لقدرتها على فهم الفيديو بشكل متقن لا يزال يمثل تحديًا. حيث إن المعايير الحالية تعتمد غالبًا على الإجابة عن الأسئلة أو مطابقات النصوص الحقيقية، مما يسمح للنماذج بالنجاح من خلال الاعتماد على إشارات سطحية وتوصيفات غير مكتملة.

لذا، نقدم لكم معيار فيدو أومني-بينش (VidOmni-Bench)، وهو معيار يتطلب من النماذج التحقق من مدى دعم كل حدث في النصوص الكثيفة للفيديو من خلال الفيديو نفسه. يتكون فيدو أومني-بينش من 500 فيديو تشمل خمس أنواع من التعقيدات وتنوعات زمنية تتراوح من 4 ثوانٍ إلى 90 دقيقة.

بعد جمع هذه الفيديوهات، استخدمنا نماذج متنوعة من Video-LLMs لإنتاج تسميات كثيفة والحصول على تصنيفات معتمدة من قبل بشر على مستوى الجملة، حيث تعتبر الجمل التي تحتوي على أحداث غير صحيحة نقاط سلبية صعبة للتقييم.

كشفت تجاربنا على فيدو أومني-بينش عن ثلاث اكتشافات رئيسية:
1.生成的描述具有幻觉特点,即 نماذج اللغات الضخمة غالبًا ما تنتج أوصافًا غير منطقية عند وصف الفيديوهات الكثيفة.
2. تعاني النماذج من ضعف كمدققين، ولا تستطيع الكشف بشكل موثوق عن أوصاف الأحداث المحتملة ولكن غير الصحيحة.
3. تتفاوت نقاط الضعف بين النماذج بحسب تعقيد الفيديو ومدة الحدث، مما يكشف عن نقاط اختناق متنوعة تتعلق بالنماذج الحالية.

في ضوء هذه الاكتشافات، يظهر معيار فيدو أومني-بينش كأداة قوية لمواجهة التحديات المستمرة في مجالات الذكاء الاصطناعي لفهم الفيديو، مهيئاً الطريق لتطوير نماذج أكثر موثوقية وفعالية في المستقبل.