في عالم الذكاء الاصطناعي، تبرز نماذج الانتباه الخطية المتكررة (Recurrent Linear Attention Models) مثل Mamba كبديل فعال لنماذج Transformers. ومع ذلك، يعاني هذا النموذج من قيود في القدرة على إدارة التسلسلات الطويلة بسبب حالاته المتكررة ذات السعة الثابتة. لذا، تم اقتراح نموذج Mamba مع الذاكرة الهرمية (Hierarchical Memory Mamba - HMM) لتجاوز هذه العقبة، مستلهمًا من طريقة عمل الذاكرة البشرية الهرمية.
يبني نموذج HMM على الهيكل الأساسي لـ Mamba ولكنه يدمج ذاكرة عاملة خفيفة الوزن تستخرج دلالات بطول الفقرة (Paragraph-Level Semantics - PLS) من الذاكرة الحسية السريعة المدمجة في حالات النموذج المخفية. تُضغط الـ PLS فيما بعد إلى ذاكرة طويلة الأمد يمكن استرجاعها بشكل فعال وفقًا لمتطلبات المهمة.
تعمل هذه المعالجة الهرمية للمعلومات الدلالية على التغلب على نقاط الضعف في تمثيل النماذج الخطية المتكررة وتمنح نموذج HMM تعميمًا عبر المهام من خلال التعلم المعلمي، وهو ما لا يتم ملاحظته في المتغيرات الأخرى المعززة للسياق الطويل من Mamba.
أظهرت الاختبارات على مهام استرجاع المفتاح (Passkey Retrieval) وLongBench-E أن نموذج HMM يعزز معدل نجاح الاسترجاع بنسبة تتراوح بين 34.3٪ إلى 37.1٪ ودقة الاستدلال بنسبة تتراوح بين 1.6٪ إلى 14.2٪ بالمقارنة مع نماذج Mamba القوية، بينما لا يضيف سوى 2٪ من المعلمات الإضافية وبدون مجهود تدريبٍ إضافي يذكر.
إن التطورات التي يقدمها نموذج HMM تمثل خطوة هامة نحو تحسين نمذجة التسلسلات الطويلة وتطبيقاتها المتنوعة في الذكاء الاصطناعي. ما رأيكم في هذه الابتكارات الجديدة؟ شاركونا في التعليقات!
Mamba مع الذاكرة الهرمية: ثورة في نمذجة التسلسل الطويل!
تقديم نموذج Mamba مع هيكلية ذاكرة هرمية يتجاوز التحديات التقليدية في نمذجة التسلسلات الطويلة. يعزز هذا النموذج الذاكرة طويلة الأمد ويزيد من دقة استرجاع المعلومات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
