شهدت تقنيات توليد الفيديو تقدمًا ملحوظًا في إنتاج نتائج مرئية جذابة ومتسقة زمنيًا، ولكن تبقى مسألة ما إذا كانت هذه النماذج قادرة على التفكير حقًا من خلال الفيديو أم لا، موضع تساؤل مستمر. لقد تم طرح نماذج تقييم تقيس فقط الجوانب المرئية، دون الأخذ في الاعتبار الدقة العقلية. لنلقِ نظرة على VWG-Bench (اختبار العالم الفيديو الشامل)، والذي يمثل خطوة متقدمة في التقييم، إذ يغطي 9 أبعاد من التفكير و38 مهمة دقيقة.

لتسهيل التقييم الدقيق، جرى تصميم بروتوكول VLM-as-Judge المكون من ثلاثة مستويات، الذي يقوم بتقييم تدفق الفيديو، والامتثال للقواعد على مستوى المهام، وتحقيق الأهداف على مستوى العينة بشكل مستقل. وتظهر التقييمات للنماذج الرائدة فجوة ملحوظة؛ فعلى الرغم من تحقيقها درجات عالية في جودة العرض، إلا أنها تفشل باستمرار في المهام التي تتطلب منطقًا صارمًا وقيودًا واضحة.

لمعالجة هذه الفجوة، قمنا بتطوير Vid-PRE (مفكر ومُحسن المطالبات بالفيديو)، وهي أداة إعادة صياغة استباقية تعمل على تخفيف العبء العقلي على نماذج التفكير. هذه الأداة مدربة من خلال التعلم المعزز بالاعتماد فقط على المكافآت النصية، مما ينتج عنه صياغة مطلوبة بشكل مضغوط وواعية للقيود، من دون عدم الاستقرار الناتج عن إشارات المكافأة على مستوى الفيديو.

تظهر التجارب أن Vid-PRE تحقق تحسينات ملحوظة في التفكير عبر مجموعة متنوعة من مولدات الفيديو دون الحاجة إلى تعديل بنية النماذج. من خلال VWG-Bench وVid-PRE، نقدم منظارًا تشخيصيًا دقيقًا وطريقًا قابلاً للتوسع نحو قدرات التفكير الحقيقي مع الفيديو. لجميع البيانات والتعليمات البرمجية، يمكنكم الاطلاع على الرابط التالي: [huggingface.co/datasets/KlingTeam/VWG-Bench].