في خطوة متقدمة نحو تحسين جودة وفعالية توليد الفيديو، تم تقديم نظام SemComp-Bench الذي يركز على تقييم إتمام المهام الدلالية في إنشاء محتوى الفيديو. يعتمد هذا النظام على فكرة أن نجاح توليد الفيديو لا يعتمد فقط على الظهور الجمالي، بل يتطلب أيضاً تحقيق نتائج مرجوة ذات دلالة واضحة.

تتضمن العملية توافقاً بين الصورة المرجعية الناتجة والمحتوى الذي تم إنتاجه، مما يجعل من الضروري فهم المعاني والعناصر الهامة المرتبطة بالمهمة المراد تنفيذها. بفضل مجموعة بيانات SemComp-Data الاستثنائية، تم تطوير قاعدة فارقة للتقييم في ستة مجالات مختلفة، حيث تتضمن كل حالة صورة مرجعية وتعليمات تفصيلية بالإضافة إلى مقطع فيديو قصير يركز على النتيجة.

تشمل عملية التحويل مجموعة من المراحل الأربعة لإنتاج حالات موحدة من SemComp-Data من مقاطع الفيديو الأولية، مما يضمن تحقيق جودة عالية. يتبع النظام بروتوكولاً تقييمياً مبتكراً يستخدم نموذج لغة ورؤية (Vision-Language Model) للإجابة على الأسئلة الدقيقة التي تهم أداء النماذج.

تحتوي النتائج على نقاط OA وGR، التي تقيم نجاح الإنجاز وموثوقية التوليد على التوالي. ومع ذلك، أظهرت التجارب أن الحفاظ على توافق دلالي مع الصور المرجعية يبقى تحدياً بارزاً.

يرسم هذا النظام آفاقاً جديدة في مجال إنتاج الفيديو ويقدم أدوات قوية لتقييم الأداء، مما يعيد تعريف الحدود الممكنة في كيفية فهم نماذج الذكاء الاصطناعي لمهام وتوقعات معقدة.