في عالم الروبوتات، تعتبر عملية التحريك من المجلات المثيرة للاهتمام والتحديات المثيرة. غالبًا ما تحتاج الروبوتات إلى التعامل مع معلومات لم تعد مرئية، وهو ما يجعل تقييم سياسات الحركة وفقًا للرؤية واللغة والعمل (Vision-Language-Action) مسألة حساسة. حيث تُظهر المعايير الحالية للذاكرة في الروبوتات فجوة كبيرة، إذ تعتمد بالأساس على نجاح المهمة النهائية، مما يخلط بين نسيان المعلومات وفشل العملية.

معايير MEMOBench تم تطويرها لحل هذه المشكلة، حيث تقدم بنية جديدة لتقييم الذاكرة على مستوى العمليات في الروبوتات. يتضمن هذا المعيار 30 مهمة تعتمد على التاريخ، و1,500 عرض توضيحي من الخبراء، و4,200 حالة نقاط تفتيش قابلة للتنفيذ من 84 نموذجًا. كل نقطة تفتيش تربط بين اللغة الخشنة والدقيقة مع حقيقة المحاكي وتحدد عملية ذاكرة واحدة: التخزين (Storage)، التحديث (Update)، أو الضغط (Compression).

تساعد هذه التوصيفات في قياس معدل تخزين الذاكرة، ومعدل تحديث الذاكرة، ومعدل ضغط الذاكرة، مما يتيح قياس دقة الذاكرة إلى جانب نجاح المهمة. على الصعيد الآخر، يظهر أن أفضل وحدة ذاكرة أساسية تصل فقط إلى 31.9% في معدل النجاح المتوسط، وغالبًا ما يتواجد التخزين العالي مع تحديث ضعيف وضغط.

بالإضافة إلى ذلك، توفر اللغة المتعلقة بنقاط التفتيش إشرافًا على الأهداف الذاكرية، مما يؤدي إلى تحسينات متوسطة عبر عمليات الذاكرة المختلفة. يتيح معيار MEMOBench مجموعة تقييم تشخيصية وإشراف تدريب لسياسات الروبوتات الموجهة نحو الذاكرة، مما يعزز من تطور وفعالية هذه النماذج.

لمعرفة المزيد عن هذا المشروع الرائد، يمكنكم زيارة الصفحة الرسمية لمعيار MEMOBench على GitHub.