تواجه نماذج اللغات الكبيرة المتعددة الوسائط (Multimodal Large Language Models - MLLMs) تحديات كبيرة عندما يتعلق الأمر بفهم الفيديوهات الطويلة. ومن أبرز هذه التحديات هو الكم الهائل من الرموز المرئية التي تشبع نوافذ السياق، مما يؤدي إلى تكاليف باهظة. غالبًا ما تعتمد الحلول الحالية على نماذج مساعدة لتقليل عدد الرموز، لكنها تواجه معضلة رئيسية: حيث أن الطرق التي تعتمد على التشفير الخفيف غالبًا ما تتجاهل معلومات دلالية هامة، بينما تؤدي الأساليب الثقيلة إلى تقليل فائدة الكفاءة.

في بحثنا الجديد، نستكشف inefficiency (عدم الكفاءة) أساسي يتعلق بهذا التحدي. بينما تعتبر التفاصيل الدقيقة للصور ضرورية لفهم عميق، إلا أنها غالبًا ما تكون زائدة عن الحاجة عند اختيار المناطق ذات الصلة دلاليًا.

لهذا السبب، نقدم لكم **VideoMM**، الذي يمثل تحولًا جوهريًا من نهج تقليدي يعتمد على تقليل حجم النموذج إلى رأسية جديدة تركز على التكيف في التفاصيل الإدراكية. حيث يقوم نظامنا بفصل عملية الاختيار عن التفكير، وتنفيذ تصفية دلالية باستخدام **Macro Proxy** (الذي يتم الحصول عليه من الإطارات المصغرة)، ثم يتم إسقاط المناطق المختارة على **Micro Tokens** (رموز مصغرة) لفهم تفصيلي عندما يكون ذلك مطلوبًا فقط.

عبر تقييمات شاملة، أظهرت VideoMM أداءً متفوقًا على الحلول الحالية، حيث حققت سرعة تفوق تصل إلى 6.13 مرة وتحسينًا في الدقة بنسبة 7.4% مقارنةً بنماذج السياق الكامل على LongVideoBench. كما أنها تسارع الاستدلال بمعدل 2.73 مرة فوق الأساليب الرائدة الحالية، مما يؤسس نموذجًا عالي القابلية للتوسع لفهم الفيديوهات الطويلة.

للاستزادة، يمكنكم الاطلاع على الشيفرة البرمجية الخاصة بنا هنا: رابط الشيفرة. ما رأيكم في هذا التطور المثير؟ شاركونا في التعليقات!