برزت نماذج رؤية اللغة-الإجراء (VLA) في الآونة الأخيرة كأحد أهم التطورات في مجال الروبوتات، حيث أظهرت تقدماً ملحوظاً في مهام التلاعب الروبوتي المعتمد على اللغة. ومع ذلك، كانت التقييمات السابقة تأخذ في الاعتبار فقط المهام ضمن ظروف محددة مسبقاً مما جعلها تفتقر إلى العمق في تحليل كيفية تفكير هذه النماذج في ظل تعقيدات فضائية وإجرائية متزايدة.

هنا تأتي RoboSPA، وهي مجموعة بيانات جديدة تهدف إلى تشخيص التفكير المادي في نماذج VLA. تركز RoboSPA على بعدين رئيسيين: التفكير المكاني الدقيق والتخطيط الإجرائي طويل الأمد. تشمل المجموعة 10 فئات من المهام و56 مهمة أساسية، كل منها يتم إنشاؤه على خمس مستويات من الصعوبة، مما ينتج عنه 280 م variant بكل تعقيد فضائي وعملي.

تجمع RoboSPA أيضاً 527,000 مسار عبر نماذج متعددة وبيئات متنوعة. وتجاوزت المعايير التي تم تقديمها لمعدل النجاح الثنائي، إذ تم إدخال مقاييس تشخيصية أكثر تفصيلاً للتقييم.

أظهرت التجارب على نماذج VLA الممثلة أن الأنظمة الحالية لا تزال تواجه صعوبات كبيرة في التعامل مع العلاقات المكانية المعقدة، والتنفيذ الدقيق للمستويات المنخفضة، والتخطيط الذي يتطلب ذاكرة كبيرة. تؤكد هذه النتائج على أهمية RoboSPA كمعيار تشخيصي يطرح تحديات حقيقية أمام تطوير وكلاء أكثر كفاءة وقابلية للتكيف.

يمكنكم الاطلاع على البيانات والكود الخاص بـ RoboSPA عبر رابط المشروع على GitHub. ما رأيكم في هذا التطور في نماذج الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!