في عالم الذكاء الاصطناعي، تتعدد الأبعاد والمعايير التي تشكل تحليلاتنا وفهمنا للمحتوى المرئي. ورغم أن نماذج الفيديو-اللغة (Video-Language Models) تتمتع بفهم متعدد الوسائط القوي، إلا أنها لا تزال تعاني من مشكلة الهلوسات، خصوصًا عند التفكير في الأفعال وترتيب الأحداث الزمنية.
تتضمن الاستراتيجيات الحالية للتخفيف من هذه المشكلة طرقًا مثل تصفية النصوص أو التحوير العشوائي للفيديو، لكن غالبًا ما لا تعالج هذه الحلول السبب الجذري: الاعتماد المفرط على الأولويات اللغوية بدلاً من الديناميات البصرية الدقيقة.
لذا، تم تقديم إطار عمل جديد يتيح توليد فيديوهات مضادة (Counterfactual Video Generation)، يركز فقط على الأفعال أو الهيكل الزمني مع الحفاظ على سياق المشهد. يقوم هذا النظام بتجميع نماذج اللغات الضخمة (Large Language Models) التي تساعد في اقتراح الأفعال وتوجيه التعديل مع نماذج الصور والفيديو المعتمدة على التشتت (Diffusion).
من خلال هذا الإطار، تم إنشاء CounterVid، مجموعة بيانات اصطناعية تضم حوالي 26,000 زوج تفضيل تم تشكيلها من مقاطع أفعال قصيرة مضادة، مستهدفةً كلًا من التعرف على الحركة وترتيب تسلسل الأفعال بشكل محكم.
كما تم تقديم MixDPO، وهو نهج موحد لتحسين التفضيلات المباشرة، يدمج بشكل جماعي بين التفضيلات النصية والبصرية.
يشير تقييم هذه الأنظمة على نماذج Qwen2.5-VL وInternVL3 إلى تحسينات ملحوظة في التعرف على الحركة وترتيب الأحداث الزمنية. النتائج أظهرت تقدماً في أغلب المعايير القياسية لمشكلة الهلوسة في الفيديو، مع الحفاظ على الفهم العام للفيديو.
لتوسيع نطاق أبحاثك، يمكنك زيارة الرابط الرسمي لمجموعة البيانات والنماذج المتاحة. هل تتوقع تأثيراً كبيراً لمثل هذه الابتكارات في تطوير نموذج الفيديو-اللغة؟ شاركونا آراءكم في التعليقات!
ثورة في نماذج الفيديو: CounterVid تقضي على الهلوسات الزمنية وتعزز فهم الحركة!
تقديم CounterVid يتيح إنتاج فيديوهات مضادة تعالج مشكلات الهلوسة الزمنية في نماذج الفيديو-اللغة. نظام جديد يعد بخفض الأخطاء وزيادة دقة التعرف على الحركة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
