في عالم الذكاء الاصطناعي، تعتبر قدرة الروبوتات على التفاعل مع بيئتها وتذكر المعلومات ذات أهمية قصوى. ولذا، يأتي MIKASA-Robo-VLA ليعيد تعريف كيفية قياس فعالية نماذج اللغة والصورة في تنفيذ المهام المعقدة التي تتطلب ذاكرة فعالة.

تعمد MIKASA-Robo-VLA إلى تقديم 90 مهمة من مهام المناورة المشروطة باللغة، حيث تمتاز 80 منها بإخفاء إشارة تعتمد عليها الأعمال، مما يجعلها أكثر تحديًا. تعتمد 32 مهمة من هذه المهام على هيكل مفوض للبيانات باللغة. يتم تقييم أدائها بناءً على الزمن الفعلي الذي يمكن أن تسترجع فيه المعلومات.

تتضمن التجربة 22,500 مسار أوركلي عبر 10 أنواع من الذاكرة، حيث تم ضبط نموذج مرجعي لتحقيق نتائج متوسطة تبلغ 0.211. يعد هذا الإنجاز مثيرًا، خاصةً أن الأداء كان مرتبطًا بعدد الإشارات المفقودة في المهمات.

بفضل هذا المعيار، يصبح بالإمكان قياس فعالية التحكّم في الروبوتات بشكل أدق، مما يفتح الأبواب لتطبيقات مستقبلية في مجالات الروبوتات المتقدمة.