في عالم الرؤية المرئية القائمة على اللغة (Vision-Language Models) التي شهدت نجاحات كبيرة في فهم الصور، يبدو أن الفيديوهات تشكل التحدي الأكبر. تعتمد هذه النماذج بشكل كبير على توفر أزواج من الصور والنصوص بجودة عالية، ولكن أداءها يتراجع في مجال الفيديو بسبب الحاجة إلى فهم الزمن وندرة البيانات الكبيرة المعلمة.

لحل هذه الإشكالات، تم تطوير قاعدة بيانات جديدة تُدعى MarineEVT، والتي تركز على فهم الفيديوهات البحرية. هذه القاعدة تحتوي على 20,000 زوج من الأسئلة والأجوبة المتعلقة بالفيديو، مما يتيح لنا تحليل عميق لديناميات المحيطات.

كجزء من هذا العمل, تم تقديم EVT-R1، وهو نموذج ثوري يتبنى عملية تفكير مدمجة باستخدام أدوات بصرية قوية لفهم العوامل الحقيقية وراء الأحداث البحرية. باستخدام EVT-R1، استطاعت الدراسة تحسين أداء فهم الفيديو بمعدل يتجاوز ما حققته 11 نموذجًا مختلفًا، حيث سجّلت نتائج أعلى بنسبة 5.22% من النماذج المفتوحة المصدر وبنسبة 11.09% من النماذج التجارية المتقدمة.

تعمل MarineEVT وEVT-R1 على دعم التعليم البيئي وتعزيز الفهم المستدام لديناميات البحر، مما يمهد الطريق لتطبيقات جديدة في استكشاف البيئات البحرية وتعزيز التعليم البيئي.