تعتبر قدرة نماذج اللغات متعددة الوسائط (Multimodal Large Language Models - MLLMs) على فهم الفيديو المباشر خطوة حاسمة في عالم الذكاء الاصطناعي، حيث تحتاج هذه النماذج إلى الانتقال من المعالجة الأوفلاين (offline) إلى الفهم الفوري والفيديو المباشر. ولكن، ما تعاني منه الأساليب الحالية هو عدم القدرة على التكيف المرن، مما يؤدي إلى فقدان التفاصيل الهامة وتجزئة السياق.

لحل هذه المشكلة، تم تقديم FreshMem، وهي شبكة ذاكرة هجينة تعتمد على مفهوم ‘الذاكرة والقدرة الإدراكية’ المعتمدة على الدماغ. تقدم FreshMem توازنًا بين الدقة القصيرة الأمد والتماسك طويل الأمد عبر وحدتين تفاعليتين: الذاكرة الترددية متعددة المقاييس (Multi-scale Frequency Memory - MFM)، التي تقوم بتحويل الإطارات الزائدة إلى معاملات ترددية تمثيلية، ويتم تعزيزها بالتفاصيل المتبقية لإعادة بناء الصورة العامة للتاريخ، وذاكرة الصورة الفراغية (Space Thumbnail Memory - STM)، التي تقوم بتحويل التدفق المستمر إلى مجموعات حدثية باستخدام استراتيجية ضغط تكيفية، مما يضمن استخراج صور عالية الكثافة.

أظهرت التجارب المكثفة أن FreshMem تحسن أداء نموذج Qwen2-VL في عدة اختبارات، مع تحقيق تحسينات تصل إلى 5.20%، 4.52%، و2.34% في اختبار StreamingBench وOV-Bench وOVO-Bench على التوالي. كحل بدون الحاجة للتدريب، تتجاوز FreshMem العديد من الأساليب التقليدية التي تتطلب ضبطًا كاملاً، مما يتيح تحقيق كفاءة عالية في فهم الفيديو المباشر على المدى الطويل.

لذا، هل أنتم مستعدون لاستكشاف مستقبل فهم الفيديو؟ كيف ترون تأثير FreshMem في تطوير الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!