في إنجاز جديد في عالم الذكاء الاصطناعي، تم الإعلان عن تحدي EgoCross خلال ورشة EgoVis 2026 ضمن مؤتمر CVPR. يهدف هذا التحدي إلى تقييم قدرات نماذج اللغة الكبيرة (Large Language Models) المزدوجة الوسائط في فهم الفيديوهات من وجهة نظر شخصية.
تضمن التحدي مقاطع فيديو تنتمي لأربعة مجالات محددة: الجراحة، التجميع الصناعي، الرياضات المتطرفة، ووجهات نظر الحيوانات. يعتمد كل اختبار على مقطع فيديو قصير، سؤال، وأربع إجابات ممكنة، حيث يتعين على النموذج اختيار الخيار الصحيح.
الشكل العنكبوتي لهذا التحدي يأتي من خلال مسارين رسميين: المسار محدود الموارد (Source-Limited Track) والذي يقيّد المشاركين لاستخدام نموذج أساسي رسمي ومجموعة دعم صغيرة، في حين يسمح المسار مفتوح المصدر (Open-Source Track) بخيارات أوسع من نماذج بيانات التدريب.
لقد حصل التحدي على أكثر من 1500 تقدير من 130 مشاركاً، حيث شاركت 19 فريقًا في المسار المفتوح و38 فريقًا في المسار المحدود. كما تم الإعلان عن النتائج الرسمية لجدول الترتيب وحلول الفرق الفائزة.
نتطلع إلى أن يكون هذا التقرير مرجعًا تقنيًا مفيدًا للارتقاء بفهم الفيديوهات من منظور شخصي عبر المجالات المختلفة. جميع الموارد المتعلقة بالتحدي بما في ذلك بيانات التحدي وتنفيذ القاعدة، قد تم توفيرها للجمهور.
تحدي EgoCross: انطلاقة جديدة في فهم الفيديوهات من منظور أول بأحدث ما توصلت إليه التكنولوجيا!
استضافت ورشة EgoVis 2026 تحدي EgoCross، الذي سلط الضوء على قدرة نماذج الذكاء الاصطناعي على فهم مقاطع الفيديو من وجهة نظر شخصية. شارك أكثر من 130 متسابقاً في هذا التحدي، مما يعكس تقدمًا كبيراً في مجال معالجة الفيديوهات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
