في عالم متسارع يتطلب منا فهم المزيد من المعلومات ضمن فترات زمنية طويلة، تبرز الحاجة إلى تقنيات متقدمة في الذكاء الاصطناعي. وقد أظهرت دراسة حديثة، نُشرت على منصة arXiv، كيف يمكن لنموذج "سير ذاتية للموجودات" (Grounded Entity Biographies - GEB) أن يمكّن النماذج من التفاعل بشكل فعّال مع محتوى الفيديوهات الطويلة.
تتعلق التحديات الرئيسية في فهم الفيديوهات الطويلة بربط الأحداث متعددة الأبعاد التي تتضمن نفس الكائنات عبر فترات زمنية قد تمتد لعدة ساعات أو أيام. حيث أن الوصف الزمني والنماذج المشتقة من النصوص قد يترك الهوية الفعلية للكائن غير واضحة، مما يجعل استرجاع الأحداث ذات الصلة في الفيديوهات أمرًا معقدًا للغاية. هنا يأتي دور نموذج GEB، الذي يتيح استرجاع الملاحظات المرئية المرتبطة بنفس الكائن عبر الفيديوهات المختلفة، ويجمعها ضمن سير ذاتية قابلة للاسترجاع.
تُظهر النتائج التي أُجريت على مجموعات بيانات تشمل تسجيلات تمتد ليوم كامل وأسبوع كامل، تحسنًا في الأداء مقارنةً بالأطر السابقة. فقد حقق نموذج GEB نسبة دقة تصل إلى 72.0% في اختبار EgoLifeQA، وهو ما يزيد بمقدار 4.4 نقطة عن أفضل النتائج المنشورة سابقًا. ويشير التحليل إلى أن الربط بين الهوية المعززة وقراءة السير الذاتية يسهم بشكل كبير في تحقيق هذه النتائج.
إن كان لديك اهتمام بتطورات الذكاء الاصطناعي وكيف يمكن تطبيقها في فهم المحتوى المعقد، فما رأيك في هذا التطور؟ شاركونا بجميع أفكاركم وآرائكم في التعليقات!
تجاوز الزمن: تعزيز ذاكرة الفيديوهات الطويلة بسير ذاتية للموجودات!
تقدم دراسة حديثة إطار عمل مبتكر يربط الأحداث في الفيديوهات الطويلة بالموجودات الفعلية، مما يسهل إجابة الأسئلة المعقدة. سير ذاتية للموجودات تُحسن من أداء النموذج في استرجاع المعلومات بشكل مذهل!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
