في عالم تقنيات الذكاء الاصطناعي، يأتي CapMem كابتكار يهدف لتحسين آلية تعامل النماذج اللغوية مع الفيديوهات. إذ أن المساعدات القابلة للارتداء تحتاج إلى ذاكرة أحداث فعالة، ولسوء الحظ، تواجه النماذج الحالية الكثير من التحديات، بما في ذلك حدود الإطارات وكلفة الرموز المرئية. لذلك، قمنا بدراسة إمكانية استخدام العناوين كنموذج ذاكرة يمكن إعادة استخدامه.
CapMem يقدم إطارًا مبتكرًا يتضمن_75_ فيديو يصل مجمل مدتها إلى _33.7_ ساعة بالإضافة إلى 1000 سؤال متعدد الخيارات موزعة على 16 سيناريو مختلف. النتائج أظهرت أن استخدام نماذج_caption QA_ مع فترات زمنية مختلفة يبلغ طولها بين 30 و60 ثانية، يتفوق على النماذج التقليدية لأكثر من _10_ من أصل _12_ نموذجًا.
علاوة على ذلك، تجربتنا مع نماذج Qwen أظهرت زيادة دقة تصل إلى _5.3_ نقاط نتيجة استخدام نماذج موجهة تعتمد على العناوين. هذه النتائج تدعم فعالية ذاكرة العنوان في تحسين الفهم المنطقي للفيديوهات ذات الاتجاه الذاتي، مما يحدث تحولاً في الطريقة التي نتفاعل بها مع المحتوى المرئي.
في النهاية، نتسائل: هل سيعيد CapMem تعريف كيفية تحسين مساعدتنا الذكية لفهم سلوكنا من خلال الفيديوهات؟ شاركونا آراءكم في التعليقات!
CapMem: معيار ثوري لذاكرة الأحداث في الفيديوهات الموجهة ذاتياً!
تم الكشف عن CapMem، معيار مبتكر يستخدم العناوين كنموذج لذاكرة الأحداث في الفيديوهات الموجهة ذاتياً. هذا الإنجاز يعد خطوة جديدة في تطوير مساعدات شخصية ترتكز على الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
