تُواجه نماذج الرؤية-اللغة-الإجراء (Vision-Language-Action Models) تحديًا كبيرًا في التكيف مع البيئات المتغيرة حيث تتغير ديناميات العالم. على الرغم من أن الأبحاث الأخيرة قد دمجت بين نمذجة العالم والتنبؤ بالإجراءات لتحسين أداء هذه النماذج، إلا أن الأساليب الحالية تظل معتمدة بشكل أساسي على التدريب المسبق على مجموعات بيانات ثابتة، مما أدى إلى عدم القدرة على التكيف النشط عند وقت النشر.

مؤخراً، تم تقديم إطار WorldAgen، والذي يعد ثورة في هذا المجال، حيث يجمع بين نمذجة العالم والتنبؤ بالإجراءات مع السماح بتدريب نموذج العالم في وقت الاختبار (Test-Time Training - TTT) للتكيف مع البيئات الجديدة بشكل فعال. يعتمد WorldAgen على بنية مُشتركة تعتمد على Transformer مع رأسين:
1. رأس نمذجة العالم، الذي يتنبأ بالحالات المستقبلية استنادًا إلى مسارات الحالة-الإجراء السابقة.
2. رأس نموذج الوكيل، الذي يتنبأ بالإجراءات وفقًا لتعليمات المهام.

تم تصميم نظام انتباه موجه مختلط لفصل هذين النموذجين. خلال وقت الاختبار، يقوم WorldAgen بعينة إجراءات استكشافية، ويجمع التحولات الحقيقية للحالة، وينفذ تحديثات TTT خفيفة لتحسين نموذج العالم الخاص به. هذه العملية تعزز فهم النموذج للبيئة مما يؤدي إلى تحسين دقة التنبؤ بالإجراءات.

تظهر التجارب على معيارَي CALVIN و LIBERO أن النموذج الأساسي الخاص بنا يحقق أداءً مقاربًا، وفي بعض الحالات متفوقًا، مقارنةً بالأساليب الحالية الرائدة. علاوة على ذلك، مع استخدام TTT على عدد قليل من العينات، يبرز أسلوبنا كأفضل من النماذج الحالية، مما يبرز فعالية التكيف مع نماذج العالم في وقت الاستدلال.