في عصر تتزايد فيه الحاجة إلى فهم الفيديوهات الطويلة، يُعَدُّ نموذج CADER (Confidence-Aware Dynamic Evidence Reasoning) حلاً ثورياً يسعى لتعزيز هذا المجال. يعتمد الطرح الحديث على استخدام نماذج الرؤية-اللغة الكبيرة (Large Vision-Language Models) والأساليب المدعومة بالأدوات لتحسين عملية استنتاج الأدلة.
عادةً ما تُطبق الأنظمة الحالية نفس إجراءات الاستنتاج على جميع الأمثلة، دون مراعاة مستوى الصعوبة. يؤثر هذا النهج على كفاءة معالجة الأسئلة، حيث يستدعي عمليات غير ضرورية لبعض الأسئلة السهلة، ويقلل من السيطرة على السيناريوهات الأكثر تعقيداً.
يأتي CADER ليُحدث نقلةً نوعية. فهو أولاً يقوم بإجراء استنتاج عالمي على إطارات مختارة، ثم يُقدِّر ثقة الإجابات باستخدام إشارة هامش اللوغيت، مما يسمح للأمثلة عالية الثقة بالخروج مبكراً. أما بالنسبة للأمثلة ذات الثقة المنخفضة، فيُفعل CADER حلقة إضافية مدعومة بالأدوات تدمج بين عملية قص زمني خفيفة، والتحقق الدلالي، وإعادة التحميل المدروسة، لتحديد الأدلة ذات الصلة بالسؤال بشكل تدريجي.
ما يميز هذا النموذج هو كيفية تعامله مع استخدام الأدوات، حيث يعتمد على قرار مستوى العينة. بحيث يتعامل مع الحالات السهلة بتمريرة عالمية، بينما يُخصص المزيد من الاستنتاج للحالات التي تشير فيها الشكوك إلى الحاجة لمزيد من الأدلة.
تُظهر التجارب على معايير VideoQA المتنوعة أن CADER يحسن استنتاج الفيديوهات الطويلة ويجتاز المرحلة الثانية بالنسبة للعناصر العالية الثقة. بل إن تطبيقه على هيكل تدريبي فقط باستخدام إشراف خالي من الأدوات يظهر أداءً تنافسياً يتفوق على الأطر المتخصصة المدعومة بالأدوات، مما يشير إلى مسار عملي قابل للتطبيق في أوقات الاستنتاج.
هل أنتم متحمسون لهذا التطور في فهم الفيديوهات الطويلة؟ شاركونا آراءكم وتجاربكم في التعليقات!
CADER: الثقة الديناميكية في استنتاج الأدلة لفهم الفيديوهات الطويلة
تقدم CADER إطار عمل مبتكر لتعزيز فهم الفيديوهات الطويلة من خلال تحسين استنتاج الأدلة. يعتمد النظام على استراتيجيات ديناميكية لضبط الثقة وتحسين التحليل الزمني.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
