تعتبر قدرة نماذج اللغات متعددة الوسائط (Multimodal Large Language Models - MLLMs) على فهم الفيديو المباشر خطوة حاسمة في عالم الذكاء الاصطناعي، حيث تحتاج هذه النماذج إلى الانتقال من المعالجة الأوفلاين (offline) إلى الفهم الفوري والفيديو المباشر. ولكن، ما تعاني منه الأساليب الحالية هو عدم القدرة على التكيف المرن، مما يؤدي إلى فقدان التفاصيل الهامة وتجزئة السياق.
لحل هذه المشكلة، تم تقديم FreshMem، وهي شبكة ذاكرة هجينة تعتمد على مفهوم ‘الذاكرة والقدرة الإدراكية’ المعتمدة على الدماغ. تقدم FreshMem توازنًا بين الدقة القصيرة الأمد والتماسك طويل الأمد عبر وحدتين تفاعليتين: الذاكرة الترددية متعددة المقاييس (Multi-scale Frequency Memory - MFM)، التي تقوم بتحويل الإطارات الزائدة إلى معاملات ترددية تمثيلية، ويتم تعزيزها بالتفاصيل المتبقية لإعادة بناء الصورة العامة للتاريخ، وذاكرة الصورة الفراغية (Space Thumbnail Memory - STM)، التي تقوم بتحويل التدفق المستمر إلى مجموعات حدثية باستخدام استراتيجية ضغط تكيفية، مما يضمن استخراج صور عالية الكثافة.
أظهرت التجارب المكثفة أن FreshMem تحسن أداء نموذج Qwen2-VL في عدة اختبارات، مع تحقيق تحسينات تصل إلى 5.20%، 4.52%، و2.34% في اختبار StreamingBench وOV-Bench وOVO-Bench على التوالي. كحل بدون الحاجة للتدريب، تتجاوز FreshMem العديد من الأساليب التقليدية التي تتطلب ضبطًا كاملاً، مما يتيح تحقيق كفاءة عالية في فهم الفيديو المباشر على المدى الطويل.
لذا، هل أنتم مستعدون لاستكشاف مستقبل فهم الفيديو؟ كيف ترون تأثير FreshMem في تطوير الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!
اكتشاف ثوري في فهم الفيديو: FreshMem - ذاكرة هجينة مستوحاة من الدماغ!
مادة FreshMem الجديدة تعد خطوة مهمة نحو تحسين فهم الفيديو المباشر من خلال ذاكرة هجينة مستوحاة من كيفية عمل الدماغ. هذه التقنية تضمن تعزيز القدرة على معالجة المعلومات بشكل مستمر وبكفاءة عالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
