في إنجاز جديد في عالم الذكاء الاصطناعي، تم الإعلان عن تحدي EgoCross خلال ورشة EgoVis 2026 ضمن مؤتمر CVPR. يهدف هذا التحدي إلى تقييم قدرات نماذج اللغة الكبيرة (Large Language Models) المزدوجة الوسائط في فهم الفيديوهات من وجهة نظر شخصية.

تضمن التحدي مقاطع فيديو تنتمي لأربعة مجالات محددة: الجراحة، التجميع الصناعي، الرياضات المتطرفة، ووجهات نظر الحيوانات. يعتمد كل اختبار على مقطع فيديو قصير، سؤال، وأربع إجابات ممكنة، حيث يتعين على النموذج اختيار الخيار الصحيح.

الشكل العنكبوتي لهذا التحدي يأتي من خلال مسارين رسميين: المسار محدود الموارد (Source-Limited Track) والذي يقيّد المشاركين لاستخدام نموذج أساسي رسمي ومجموعة دعم صغيرة، في حين يسمح المسار مفتوح المصدر (Open-Source Track) بخيارات أوسع من نماذج بيانات التدريب.

لقد حصل التحدي على أكثر من 1500 تقدير من 130 مشاركاً، حيث شاركت 19 فريقًا في المسار المفتوح و38 فريقًا في المسار المحدود. كما تم الإعلان عن النتائج الرسمية لجدول الترتيب وحلول الفرق الفائزة.

نتطلع إلى أن يكون هذا التقرير مرجعًا تقنيًا مفيدًا للارتقاء بفهم الفيديوهات من منظور شخصي عبر المجالات المختلفة. جميع الموارد المتعلقة بالتحدي بما في ذلك بيانات التحدي وتنفيذ القاعدة، قد تم توفيرها للجمهور.