في عالم الذكاء الاصطناعي، يسعى الباحثون دائمًا لصياغة تقنيات جديدة تتيح فهمًا أعمق للوسائط المتعددة. تُعتبر تقنية توضيح الأحداث في الفيديوهات (Dense Video Captioning) من أهم التطورات في هذا المجال، حيث تهدف إلى تحديد ووصف أحداث متعددة داخل فيديوهات غير محررة فقط باستخدام مجموعة مرتبة من تسميات الأحداث.
مؤخراً، قدمت الأبحاث تقنية جديدة تم تسميتها “رؤية قبل التركيب” (Seeing Before Synthesizing - SBS)، التي تعالج القصور في الأساليب السابقة التي كانت تعتمد على إنشاء تسميات مساعدة دون ربط حقيقي بالصور. إذ كانت التسميات تُعطى لكل فجوة بين الأحداث بشكل ثابت ودون اعتبار للسياق البصري.
تستخدم تقنية SBS نماذج رؤية-لغة (Vision-Language Models - VLM) لتوفير توجيه لغوي مُستند إلى الرؤية، مما يتيح إنشاء روايات على مستوى الإطارات لكل فجوة بين الأحداث. بدلاً من تحديد الفجوات الزمنية بدقة ثابتة، تفهم هذه التقنية التغيرات الدلالية مما يتيح لها تحسين فترات الأحداث الزمنية من خلال دمج النقطة الزمنية المتوسطة مع نقطة التغيير الدلالي.
أظهرت تجارب الأداء في بيانات ActivityNet Captions وYouCook2 نتائج متفوقة، مما يعكس فعالية هذا النهج الجديد. ادعوك لتحديث معلوماتك حول آخر التطورات في مجال وصف الفيديو وتمكين نفسك من فهم كيفية استخدام الذكاء الاصطناعي لتحسين كيفية معالجة المحتوى المرئي.
اكتشاف الأحداث الانتقالية في الفيديوهات: تقنيات متقدمة لتحسين وصف الفيديوهات دون إشراف كامل!
تم تقديم تقنية مبتكرة لتحسين وصف الفيديوهات متعددة الأحداث باستخدام نماذج رؤية-لغة (VLM). تعتمد هذه التقنية الجديدة على إنشاء توجيه لغوي مرئي قبل عملية التركيب، مما يزيد من دقة تسميات الفيديو.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
