في عالم الذكاء الاصطناعي، يمثل تلخيص الفيديوهات الطويلة تحديًا بارزًا لنماذج اللغات الكبيرة متعددة الوسائط (Multimodal Large Language Models - MLLMs). واليوم، يتمكن الباحثون من معالجة هذه القضية من خلال الابتكار الجديد 'LVSum'، وهو معيار تم تطويره بشكل بشري لتقييم ملخصات الفيديو الطويلة بدقة زمنية رائعة.

تتكون مجموعة بيانات LVSum من 72 فيديو متنوعًا تغطي 13 مجالًا مختلِفًا، بمتوسط مدة 16 دقيقة لكل فيديو. وقد تم وضع ملخصات بشرية وضبطها بدقة لتتضمن ما يصل إلى 10 ملخصات تحتوي على إشارات زمنية.

خلال تقييم شامل لأفضل نماذج اللغات الكبيرة - سواء التجارية أو مفتوحة المصدر - باستخدام مقاييس جديدة قائمة على LLM لتعزيز موضوعية المحتوى وتجانس الأشكال، تم الكشف عن ثلاث نتائج رئيسية:
1. تسهم النصوص المكتوبة بشكل أكبر في تحسين جودة الملخصات مقارنة بمقاطع الفيديو البصرية فقط.
2. لا يزال هناك فارق كبير في الأداء بين الملخصات التي أنشأها النموذج وتلك التي كتبها البشر.
3. تظهر نماذج MLLMs الحالية ضعفًا منهجيًا في تمكنها من القدرة الزمنية، والامتثال للتعليمات، وتجانس الأشكال المتعددة.

يسعدنا أن نعلن عن إطلاق مجموعة البيانات والكود الذي يدعم هذا الابتكار. بهذا، نحن نرى خطوة جديدة نحو تحسين جودة تلخيص الفيديوهات الطويلة، مما يجعل الأبحاث في هذا المجال أكثر فائدة وأهمية. من الواضح أن تطوير LVSum يمثل نقلة نوعية في توفر البيانات التي تعزز فهمنا لكيفية معالجة نماذج الذكاء الاصطناعي للمحتويات الطويلة.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.