تُواجه نماذج الرؤية-اللغة-الإجراء (Vision-Language-Action Models) تحديًا كبيرًا في التكيف مع البيئات المتغيرة حيث تتغير ديناميات العالم. على الرغم من أن الأبحاث الأخيرة قد دمجت بين نمذجة العالم والتنبؤ بالإجراءات لتحسين أداء هذه النماذج، إلا أن الأساليب الحالية تظل معتمدة بشكل أساسي على التدريب المسبق على مجموعات بيانات ثابتة، مما أدى إلى عدم القدرة على التكيف النشط عند وقت النشر.
مؤخراً، تم تقديم إطار WorldAgen، والذي يعد ثورة في هذا المجال، حيث يجمع بين نمذجة العالم والتنبؤ بالإجراءات مع السماح بتدريب نموذج العالم في وقت الاختبار (Test-Time Training - TTT) للتكيف مع البيئات الجديدة بشكل فعال. يعتمد WorldAgen على بنية مُشتركة تعتمد على Transformer مع رأسين:
1. رأس نمذجة العالم، الذي يتنبأ بالحالات المستقبلية استنادًا إلى مسارات الحالة-الإجراء السابقة.
2. رأس نموذج الوكيل، الذي يتنبأ بالإجراءات وفقًا لتعليمات المهام.
تم تصميم نظام انتباه موجه مختلط لفصل هذين النموذجين. خلال وقت الاختبار، يقوم WorldAgen بعينة إجراءات استكشافية، ويجمع التحولات الحقيقية للحالة، وينفذ تحديثات TTT خفيفة لتحسين نموذج العالم الخاص به. هذه العملية تعزز فهم النموذج للبيئة مما يؤدي إلى تحسين دقة التنبؤ بالإجراءات.
تظهر التجارب على معيارَي CALVIN و LIBERO أن النموذج الأساسي الخاص بنا يحقق أداءً مقاربًا، وفي بعض الحالات متفوقًا، مقارنةً بالأساليب الحالية الرائدة. علاوة على ذلك، مع استخدام TTT على عدد قليل من العينات، يبرز أسلوبنا كأفضل من النماذج الحالية، مما يبرز فعالية التكيف مع نماذج العالم في وقت الاستدلال.
⏱ 2 دقائق للقراءة👁 0 مشاهدة
اكتشف WorldAgen: إطار موحد للتنبؤ بالحالة والإجراءات مع تدريب النموذج العالمي في وقت الاختبار!
أطلق الباحثون إطار WorldAgen الذي يجمع بين نمذجة العالم والتنبؤ بالإجراءات، مما يُحسن أداء نماذج الرؤية-اللغة-الإجراء في بيئات جديدة. هذا النظام المبتكر يعد بتحسين التكيف خلال وقت الاختبار، مما يؤدي إلى نتائج دقيقة ومتفوقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
