في السنوات الأخيرة، شهدنا تقدمًا مذهلاً لنماذج اللغات الضخمة (Large Language Models) في مجال استرجاع المعلومات، لكن معظم الأبحاث قد ركزت بشكل رئيسي على النصوص أو الإعدادات المتعددة الوسائط الثابتة. وعلى الرغم من ذلك، لا يزال استرجاع مشاهد الفيديو المفتوح، الذي يتطلب بنية زمنية أكثر ثراء وسمات معقدة، يفتقر إلى المعايير والنماذج التحليلية اللازمة.

لملء هذه الفجوة، يتم تقديم نظام "ShotFinder"، الذي يحدد متطلبات التحرير من خلال أوصاف مشاهد موجهة بمفاتيح، ويقدم خمسة أنواع من القيود القابلة للتحكم: الترتيب الزمني، اللون، نمط العرض، الصوت، والدقة. تم تغطية 1,210 عينة عالية الجودة من موقع يوتيوب، تغطي 20 فئة موضوعية، باستخدام نماذج كبيرة للتوليد مع التحقق البشري.

يقدم ShotFinder نظام استرجاع وتحديد ثلاثي المراحل يقوده النص: (1) توسيع الاستعلام من خلال خيال الفيديو، (2) استرجاع الفيديوهات المرشحة باستخدام محرك بحث، و(3) تحديد المشهد الموجه بالوصف. التجارب على عدة نماذج مغلقة المصدر ومفتوحة المصدر تكشف عن فجوة ملحوظة مقارنة بالأداء البشري، مع تباين واضح بين القيود: تعتبر الموضعية الزمنية قابلة للاستخدام نسبيًا، بينما تظل الألوان ونمط العرض تحديات رئيسية.

تظهر هذه النتائج أن استرجاع مشاهد الفيديو المفتوح لا يزال قدرة حيوية تحتاج نماذج متعددة الوسائط الكبيرة لتجاوزها.