إن الذاكرة الفعالة تُعتبر إحدى الركائز الأساسية لوكلاء الذكاء الاصطناعي، ولكن كيفية بنائها بشكل فعّال لا تزال تمثل تحدياً كبيراً. تعتمد سياسة بناء الذاكرة على ما يجب استخراجه، تخزينه، تحديثه، ضغطه، أو حتى التخلص منه مع تراكم التفاعلات.

تستخدم الطرق التقليدية لبناء الذاكرة قواعد ذات طابع شخصي ومحددة للمهام، مما قد يؤدي إلى عدم توافقها مع الأهداف النهائية ويقلل من القدرة على التكيف عبر المهام المختلفة. وعلى النقيض من ذلك، تعتمد الطرق المدفوعة بواسطة التعزيز (Reinforcement Learning) على التعلم من ردود الفعل الناتجة عن المهام، لكنها عادةً ما تستخدم مكافآت على مستوى النتائج أو الوحدات. هذه الإشارات، رغم كونها تعكس نجاح المهمة، لا تستطيع تحديد المحتويات الوسيطة للذاكرة التي تدعم الإجابة النهائية، مما ينتج عنه عنق زجاجة في نسبة الاستحقاق الدقيقة.

لهذا السبب، نقترح AttriMem، وهو إطار عمل قائم على توجيه الاستحقاق (Attribution-Guided) لتوليد ردود الفعل لسياسات بناء الذاكرة باستخدام التعلم المعزز. حيث يعزز AttriMem المكافأة العالمية الناتجة من المكافآت المحلية المستمدة من المساهمات على مستوى الرموز في الإجابة النهائية.

تظهر التجارب التي أجريت على الإجابة عن الأسئلة في الحوارات طويلة الأمد أن AttriMem يتفوق على الأساليب التقليدية مثل الاسترجاع، والقواعد الشخصية، والأساليب المدفوعة بالتعزيز، ويظهر قدرة متميزة على التعميم عبر المعايير ونماذج الإجابة مما يؤدي إلى استقرار تحسين التعلم.