في عالم تتسارع فيه التطورات التكنولوجية، يأتي نظام VETO كحل مبتكر يستهدف تحسين كفاءة معالجة الفيديو باستخدام نماذج اللغة المرئية (Vision-Language Models - VLMs). حيث تواجه هذه النماذج تحديات كبيرة في المعالجة بسبب التكلفة الرباعية للتوكنات البصرية، مما يجعل معالجة الفيديوهات الطويلة شديدة التكلفة.
يقدم VETO طريقة جديدة تُعرف بضغط المحاور المزدوجة، حيث يندمج في إطار كل صورة توكنات مشابهة دلالياً عبر تقنية مستوحاة من النقل الأمثل. كما يتضمن نظام VETO ضاغطاً إضافياً يعالج الإطارات الزمنية المتكررة، ما يوفر المزيد من الكفاءة.
يرتكز تصميم VETO على الترتيب الهرمي، حيث يساهم ضغط الأبعاد المكانية أولاً في تقليل تكاليف المطابقة الزمنية العالمية، متجاوزاً حواجز الكفاءة التي تفرضها الأساليب التقليدية.
تظهر النتائج التجريبية أن VETO يمكن أن يحقق زيادة في سرعة الأداء تصل إلى 45%، كما أنه يضمن الحفاظ على الدقة أو تحسينها. وعند اختبار قدرة VETO على العمل في ظروف قاسية مثل نقص التوكنات بنسبة 10%، يتفوق هذا النظام بشكل ملحوظ على تقنيات مثل VFlowOpt وVisionZip.
تؤكد اختباراتنا على فاعلية VETO عبر عدة نماذج بما في ذلك LLaVA-OneVision وInternVL-2.5 وLongVA، مع الحفاظ على دقة عالية في جميع الحالات. بينما يواصل الذكاء الاصطناعي الابتكار، يقدم VETO نظرة واعدة للمستقبل، ما يعد بإمكانيات لا حصر لها في مجال معالجة الفيديو والنماذج اللغوية.
VETO: ثورة في تقنيات تحسين توكن الفيديو لنماذج اللغة المرئية
تمكن البحث الجديد من تطوير نظام VETO الذي يحسن من كفاءة معالجة الفيديو الطويل باستخدام نماذج اللغة المرئية. يحقق هذا النظام تحسينات تصل إلى 45% في سرعة الأداء مع الحفاظ على الدقة أو تحسينها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
