أصبح فهم المحتوى المرئي، سواء كان صورًا أو فيديوهات، أحد التحديات الأساسية في مجالات الذكاء الاصطناعي (AI). حيث تتزايد حاجة نماذج اللغة الرؤيوية (Vision-Language Models) لمعالجة كميات هائلة من البيانات المرئية بشكل سريع وفعّال.

تقدم CoVisco حلًا مبتكرًا لهذه القضية عن طريق استخدام تقنية "ضغط التوكنات الأصلية" (Native Token Compression)، والتي تستفيد من مدخلات التدقيق الشديدة. هذه التقنية تتيح لنموذج CoVisco معالجة مدخلات بصرية طويلة في تمريرة واحدة دون الحاجة إلى عمليات تفاعلات مكثفة على مستوى البقع في جميع الإطارات.

وتم تجهيز كل جزء زمني بتوكنات تجريدية قابلة للتعلم، مما يعزز من إمكانية النموذج في تقديم تمثيل مكثف مخصص لكل جزء. كما تعد الطبقات التي تقوم بالتواصل بين التوكنات المجردة جزءًا أساسيًا في الحفاظ على السياق العام للفيديو.

تخضع CoVisco لتدريب أولي مع أهداف متباينة على 565 مليون صورة ونص، بالإضافة إلى 6.4 مليون فيديو، مما يعزز من أدائها التنافسي في مجال فهم الفيديو والصور. في اختبار متقدم يتضمن أربع مقاطع و64 إطارًا، أظهرت خوارزمية CoVisco الفعالية وقدرة على استخدام 400 توكن بصري فقط، مظهرةً أداءً قريًبا من، وفي بعض الاختبارات متفوقًا على، نموذج OneVision-Encoder.

باختصار، إن CoVisco ليس مجرد نموذج جديد بل هو خطوة ثورية في عالم الذكاء الاصطناعي الذي سيُحدّد مستقبل كيف نفهم الصور والفيديو.

هل أنتم مستعدون لاستخدام هذه التقنية الجديدة في مشاريعكم؟ نحن في انتظار تعليقاتكم وآرائكم!