في عالم الذكاء الاصطناعي، تُعد الذاكرة الطويلة واحدة من المقاييس الأساسية التي يؤخذ بها عند تقييم أداء وكالات نماذج اللغة (Large Language Models) في المهام المختلفة. ومع أن الكثير من الأبحاث السابقة اعتمدت على معيار المحادثة لاستدعاء البيانات، إلا أن بحثاً جديداً قدم معياراً متقدماً يحمل اسم MERIT (تقييم الذاكرة للمهام الواقعية المجهزة).
يمتاز MERIT بكونه معياراً متكاملاً يقيس فعالية استخدام الذاكرة بالنسبة للوكالات التي تنفذ المهام، مع الأخذ بعين الاعتبار التكلفة المرتبطة بكل عملية ذاكرة. هذا يتيح فهماً أعمق لتأثير الذاكرة على نجاح الوكلاء في أداء المهام.
تتضمن منهجية MERIT تقديم مهام أدوات إبيزوديك (episodic tool-use) عبر ثلاثة مجالات، حيث يتم التحقق من الاعتماد على الحقائق من الحلقات السابقة بواسطة فحص تسرب تلقائي. يتطلب هذا النهج أيضًا القدرة على خرق الذاكرة بشكل مُراقب ومراقبة كاملة لكل عملية ذاكرة من ناحية التكلفة.
النتائج مثيرة، حيث أظهرت البيانات أن الذاكرة تعزز نجاح المهام المعتمدة على التسرب الموثق، فارقة بين النجاح في مهام مختلفة وتقديم معلومات دقيقة تتعلق بهذا النجاح. فعلى سبيل المثال، في تجربة شملت 23,440 حلقة، تم تحديد نجاح تصل نسبته إلى 55% عندما يتم استرجاع القيمة الصحيحة، بينما كانت أنواع التخزين المرتبطة بالكتابة قد حافظت على نسبة أعلى تتراوح بين 70% إلى 100%.
ما هو مثير بشكل خاص هو أن تنفيذ الذاكرة قد يؤثر على نتائج المهام بمقدار 60 نقطة، مما يعكس الحاجة إلى تحسين استراتيجيات التخزين والمراجعة لتلبية متطلبات الأداء المدروس. هذا التقدم يعكس تحولاً كبيراً في فهم كيفية استخدام الذاكرة الطويلة لتحقيق الكفاءة في العمليات المعقدة.
هل تعتقد أن تحسينات الذاكرة الطويلة ستغير مستقبل وكالات نماذج اللغة؟ شاركونا آراءكم في التعليقات!
اكتشاف قوة الذاكرة الطويلة في وكالات نماذج اللغة: تقييم تكاليف الأداء
تم تقديم معيار MERIT لتقييم الذاكرة الطويلة في وكالات نماذج اللغة وتحديد كيفية تأثير الذاكرة على أداء الوكلاء في المهام المعقدة، مع التركيز على جوانب التكلفة والكفاءة. النتائج تظهر أهمية الذاكرة في تحقيق نجاح المهام، مما يفتح آفاقاً جديدة للبحث في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
