في سعي العلوم للتقدم نحو الآفاق الجديدة، تم تقديم نموذج مبتكر يُعرف باسم نماذج العمل العالمية (World Action Models - WAMs) التي تهدف إلى مزج التنبؤ بالصور المستقبلية مع توليد حركات الروبوت. حيث تمكن هذه النماذج من تصور كيف يتطور العالم المادي خلال تفاعل الروبوتات معه.

تتفاوت نماذج WAMs الحالية في كيفية عرض الديناميات التنبؤية على مسار الحركة. بينما توفر نماذج WAMs ذات المستقبل الصريح (Explicit-future WAMs) وصولًا مباشرًا لتطور المشهد المتوقع، إلا أنها تتحمل تكاليف استنتاج كبيرة نتيجة تكرار عملية إزالة الضجيج من الفيديو.

على النقيض، تتنبأ نماذج WAMs ذات السياسات المباشرة (Direct-policy WAMs) بالحركات بشكل فعال من الملاحظة الحالية، لكنها تفتقر إلى واجهة زمن الاستنتاج لتقديم الديناميات التنبؤية إلى Action DiT. لتجاوز هذه الفجوة، تم اقتراح نموذج ForeWAM، الذي يعد نموذج WAMs المباشر المشروط بالديناميات، حيث يوفر سياقًا تنبؤيًا لتوليد الحركات دون الحاجة لتفكيك مقاطع الفيديو المستقبلية.

يستخدم ForeWAM تقنية Future-KV التي تنفذ عملية ملء مسبق واحدة لفيديو DiT على البيانات المرئية الحالية والفراغات المستقبلية العشوائية. كما يقوم بإعادة استخدام حالات المفتاح والقيمة الناتجة خلال إزالة الضجيج من الحركة. ومن خلال تقديم سجلات الديناميات التي تشرف عليها معلم حركي ثابت، يتم تشجيع الحالات المستقبلية الضمنية على التقاط التحولات المستحثة بالتفاعل مثل حركة الكائنات وتغييرات الاتصال وتقدم المهام.

تم استخدام بيانات المستقبل الحقيقية والمعلم فقط أثناء مرحلة التدريب، ولا تتطلب النشر أي توليد لمقاطع فيديو مستقبلية. دون الحاجة إلى تدريب بيانات الروبوتات بشكل متجسد، حقق نموذج ForeWAM، في نسخه القياسية والمتسارعة، معدلات نجاح تتراوح بين 96.7% و96.9% على نموذج LIBERO.

تظهر هذه النتائج أن نماذج WAMs ذات السياسات المباشرة يمكن أن تحتفظ بتنبؤ فعال للحركة بينما تعرض الديناميات التنبؤية على مسار الحركة دون الحاجة لتوليد مشاهد مستقبلية، مما يعكس نقلة نوعية في الذكاء الاصطناعي وتفاعل الروبوتات مع بيئتها.