في عصر المعلومات المتزايدة، أصبحت الفيديوهات البياناتية (Data Video) عنصرًا حيويًا في مجالات مثل تقارير الأخبار والتحليلات التجارية. تجمع هذه الوسائط بين الرسوم البيانية التفاعلية والسرد المرئي، مما يتطلب فهمًا عميقًا لتفسير المعلومات. لكن كيف يمكن لنماذج الذكاء الاصطناعي أن تفهم هذه الفيديوهات المعقدة؟
في خطوة رائدة، تم طرح بنية DataVista، التي تُعتبر أول معيار شامل لفهم الفيديوهات البياناتية، حيث تضم 961 فيديو حقيقي و6,775 سؤال تقييم مصنفة ضمن إطار عمل قدرات تدريجي من ثلاث مستويات: إدراك البيانات، التفكير الزمني، وفهم السرد. يتكون الاختبار من 10 أنواع أسئلة دقيقة تغطي خمسة مجالات موضوعية مختلفة.
عند تقييم 19 نموذجًا رئيسيًا من موديلات اللغات الكبيرة (MLLMs)، حقق النموذج الأفضل أداءً، Gemini-3.1-Pro، دقة إجمالية بلغت 70.0%، لكنها تظل بعيدة كل البعد عن أداء الخبراء البشر، خصوصًا على مستوى التفكير السببي وبنية السرد. كما أظهرت التحليلات أن زيادة عدد الإطارات وإضافة الترجمة قد تفيد في إدراك البيانات والتفكير الزمني، لكن المكاسب في فهم السرد كانت محدودة.
في نهاية المطاف، تحدد هذه المعايير الفجوات في قدرة النماذج على قراءة الرسوم البيانية وتقدير الأدلة وفهم التعليمات. يمكنكم استكشاف المزيد عن DataVista عبر الرابط التالي: DataVista على GitHub. فما رأيكم في مدى قدرة الذكاء الاصطناعي على الخوض في عالم البيانات والفيديو؟ شاركونا أفكاركم في التعليقات!
DataVista: ثورة في فهم الفيديوهات البياناتية! 🌟
تمثل DataVista المعلم الأول لفهم الفيديوهات البياناتية، حيث تجمع بين تحليل البيانات والسرد المرئي. يوضح هذا البحث الفجوة الكبيرة بين أداء نماذج الذكاء الاصطناعي وأداء الخبراء البشر في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
