في عالم الروبوتات اليوم، يتقدم التعلم على مسارين نادرًا ما يلتقيان. من جهة، لدينا سياسات ديناميكية تعتمد على الدمج بين الرؤية واللغة والإجراء (Vision-Language-Action - VLA) التي تقوم بتحويل الملاحظات إلى أفعال وتُقيم من خلال نجاح المهام المغلقة. ومن جهة أخرى، نجد النماذج العالمية التنبؤية (Predictive World Models) التي تتنبأ بالملاحظات المستقبلية وتُقيم من خلال جودة التنبؤ أو التوليد في بيئة مفتوحة.

هذا الوضع يثير سؤالًا طبيعيًا: هل تُكتسب ميزة قابلة للقياس عند استخدام نماذج العالم مقارنةً بالسياسات المباشرة، ولأي قدرات روبوتية؟ نشير هنا إلى أن المجال لم يتمكن بعد من الإجابة على هذا السؤال، وذلك بسبب وجود فجوة في أساليب القياس، وليس في النماذج نفسها. فبينما تقوم معايير النماذج العالمية بتقييم التنبؤ دون تنفيذ فعلي، تستضيف معايير نجاح المهام سياسة واحدة دون تباين بين نموذج العالم وVLA.

هذا الاستعراض يرسم ملامح مشهد التقييم المحيط بهذه الفجوة حيث تم توثيق 160 معيارًا موثقًا عبر الإنترنت منذ عام 2017 وحتى 2026، وتم تنظيمها بحسب وضع التقييم، والقدرة الروبوتية، وعائلة النموذج إلى أربع مسارات: مجموعة السياسات، و الوكلاء المتجسدين، وتقييم نموذج العالم، وجسور التنبؤ إلى العمل.

من خلال هذا الإطار، نجد أن 138 من 160 معيارًا غير مرتبطة بنموذج محدد، وأن 11 فقط (7%) تقوم بإنشاء تباين صريح بين نموذج VLA ونموذج العالم؛ بينما تعتبر القدرة المضادة شبه مجهولة، وأربعة معايير فقط حولت التنبؤ إلى عمل مُنفذ.

نساهم هنا بنظام تصنيف عملي، ومقارنة تغطي ضد أقرب ثمانية دراسات (حيث تكون دراستنا الوحيدة التي تعبر عن العلاقة بين القدرة وعائلة النموذج)، ودورة تقييم تعزل ميزة التنبؤ، وبروتوكول عملي يحتوي على أربع مقاييس واعية بالميزة مرتبطة بقاعدة بيانات معروفة.

الأساس هنا هو ليس أن النماذج العالمية تساعد أو لا تساعد، بل أن الإجابة على هذا السؤال تتطلب معايير تقييم مصممة بشكل دقيق للاستجابة له.