في عالم الذكاء الاصطناعي، يواصل الذكاء الاصطناعي المخصص لفهم الفيديو (Video Large Language Models - Video LLMs) تحقيق تقدم ملحوظ في مجموعة متنوعة من مهام فهم الفيديو. لكن، تظل السيناريوهات الخاصة بالفيديوهات الطويلة تمثل تحدياً حقيقياً بسبب التعارض بين ميزانية الرموز البصرية المحدودة والحاجة إلى التقاط الأحداث الرئيسية المتعددة.

تُظهر الطرق الحالية عادةً إنجاز المهمة في مرحلتين: الأولى تتضمن اختيار الإطارات الرئيسية، بينما الثانية تتعلق بالفهم المفصل. ومع ذلك، تفتقر هذه الحلول إلى آلية معيارية تسمح بتوزيع القدرة بشكل ديناميكي وتصحيح ذاتي، مما يؤدي إلى نمذجة غير موثوقة.

للتغلب على هذه التحديات المثيرة، تم تقديم نموذج MoD-VLLM، وهو إطار عمل مبتكر يسعى لفهم الفيديوهات الطويلة متعددة الفعاليات. يعمل هذا النموذج على توحيد التحليل الزمني والفهم الدلالي بشكل تكراري ويعتمد على أسلوب تفكير ذاتي مُحسّن. يتضمن MoD-VLLM وحدة تأطير (Grounding) للشرائح الإيجابية والسلبية، ووحدة تفكير معيارية تتيح تحديد تخصيصات دقيقة خاصة بالشرائح ذات الأهمية، مما يضمن التقاط التفاصيل الدقيقة في الوقت المناسب.

تستخدم الوحدة التوجيهية نموذج LLM للفيديو لتمييز الشرائح ذات الصلة من غيرها بناءً على السؤال المطروح. وفي الوقت نفسه، يتم الاستفادة من وحدة التفكير لديناميكية الاختيار للتشغيل الدقيق للشرائح الإيجابية للحفاظ على الفهم الكلي.

علاوة على ذلك، يتميز MoD-VLLM باستراتيجية تعلم التعزيز الديناميكي التي تمكنه من تعلم سياسات التأطير المثلى والتمثيل البصري الديناميكي بشكل متزامن. وقد تم دعم هذا التقدم بإنشاء MEventBench، وهو معيار تحدي جديد لمقاييس فهم الفيديوهات الطويلة المعقدة، مما يظهر مدى تفوق MoD-VLLM على الحلول الحالية في عدة تجارب مقارنة.

إذا كنت مهتمًا بمستقبل فهم الفيديوهات باستخدام الذكاء الاصطناعي، فإن MoD-VLLM يمثل خطوة فعالة ومشوقة نحو تحقيق ذلك!