في عالم الذكاء الاصطناعي، تمثل نماذج اللغة الكبيرة المخصصة للفيديو (Video LLMs) خطوة كبيرة نحو تحسين تحليل المحتوى البصري. على الرغم من ذلك، تواجه هذه النماذج تحديات كبيرة في أداء مهام التفكير الزمني، وهو الأمر الذي يعد ضعيفًا بصورة عامة عبر مختلف النماذج. تطلعت دراسة جديدة إلى معالجة هذا القصور عن طريق تقديم حل مبتكر يعتمد على مفهوم يسمى إدخال التنشيط الزمني (Temporal Activation Injection - TAI).
تتمثل المشكلة الأساسية في أن عكس ترتيب إطارات الفيديو - وهو تغيير يجب أن ينعكس في نتائج التوقع الزمني - غالباً ما يؤدي إلى عدم تغيير التوقع النهائي. بحثت الدراسة في جذور هذه المشكلة من خلال تعريف متجه التباين الزمني ($τ_l$)، الذي يمثل الفرق في التمثيل الطبقي الناتج عن عكس الترتيب الزمني.
متتبعين هذه الحدة عبر الطبقات، وجد الباحثون أن هناك نمط تباين زمني متسق حيث يصل ذروته في الطبقات الوسيطة، ثم يتناقص تدريجيا نحو المخرجات. تؤكد هذه النتائج أن نماذج الفيديو تتمكن من اكتساب المعلومات الزمنية في الطبقات الوسطى ولكنها تفشل في الحفاظ عليها حتى الإخراج، مما يزيد من الحاجة إلى تحسينات.
تقنية إدخال التنشيط الزمني (TAI) تستخرج τ_l عند ذروة هذا الملف لكل إدخال وتعيد حقنها في الطبقات اللاحقة بناءً على الانخفاض المقاس. وتحظى هذه الطريقة بميزة كونها لا تتطلب تدريبًا، وفي الوقت نفسه تعزز التفكير الزمني عبر ثلاث نماذج فيديو LLMs وأربعة معايير، مع تأثير ضئيل على المهام غير الزمنية.
يمكنكم الاطلاع على الكود الخاص بهذه الدراسة عبر الرابط:https://github.com/Youngwoo-git/Before-It-Fades.
كيف تعزز نماذج اللغة بتقنية الفيديو مهارات التفكير الزمني في التحليل البصري؟
توصل الباحثون إلى طريقة جديدة تعزز من قدرة نماذج اللغة الكبيرة المخصصة للفيديو على التفكير الزمني. تعالج هذه الطريقة تحديات الفهم الزمني عبر إدخال معلومات حرارية تتعلق بالترتيب الزمني للفيديو.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
