في إطار الإبداعات الحديثة في مجال النماذج اللغوية الكبيرة المتعددة الوسائط (Multimodal Large Language Models - MLLMs)، تم تقديم معيار جديد يُدعى EgoMonth. هذا المعايير يهدف إلى معالجة التحديات الراهنة في تقييم قدرة النماذج على فهم الفيديوهات الشخصية على مدار فترة طويلة، حيث تعتمد معظم المعايير الحالية على مقاطع فيديو مستخلصة من الإنترنت تفتقر إلى الاستمرارية الزمكانية بين المقاطع.
EgoMonth يأتي ببيانات غنية تتضمن أكثر من 300 ساعة من تسجيلات الحياة اليومية لـ 20 مشاركاً خلال فترات تتراوح بين 20 إلى 120 يوماً. يترافق هذا مع 1,443 زوج من الأسئلة متعددة الخيارات التي صاغها البشر، مما يقدم تحديات حقيقية لتقييم النماذج.
وقد صُممت آلية التقييم لتستند إلى إطار عمل معرفي يحتوي على 14 مهمة مرتبة في ثلاثة مستويات معرفية هرمية: دمج المخطط (Schema Consolidation)، فهرسة الأحداث (Episodic Indexing)، والتفكير المتتابع (Cascading Reasoning). تكشف التقييمات أن أفضل النماذج، مثل Gemini 2.5 Pro، لم تصل إلى أكثر من 71.8% في دقة المتوسط، مما يُظهر فجوة كبيرة تصل إلى 22.4 نقطة مئوية مقارنة بالخط الأساسي المحدد للبشر البالغ 94.2%.
تظهر النتائج أن العديد من النماذج لم تُحقق نتائج أفضل من 25% في مهام مثل التفكير في الطريق (Route Reasoning) والفهم المكاني عبر الزوايا المختلفة (Cross-view Spatial Reasoning)، مما يبرز الحاجة إلى تطوير نماذج تمتلك ذاكرة زمنية حقيقية وطويلة الأمد.
في عالم الذكاء الاصطناعي، تكشف هذه الدراسة عن قيود النماذج الحالية وتؤكد على أهمية بناء هياكل تسمح بتحقيق ذاكرة زمنية موثوقة. ما رأيكم في التقدم الذي تم إحرازه في هذا المجال؟ شاركونا آراءكم في التعليقات!
إطلاق EgoMonth: معيار الفيديوهات الشخصية لتحسين الذاكرة الزمكانية طويلة الأمد!
تم إطلاق EgoMonth، معيار الفيديوهات الشخصية الأول من نوعه الذي يركز على الذاكرة الزمكانية، بمشاركة أكثر من 300 ساعة من التسجيلات الحياتية اليومية. يكشف البحث عن أداء النماذج اللغوية الكبيرة في فهم الفيديو وضرورة تحسين قدراتها الذاكرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
