تُظهر نماذج العالم (World Models) فوائد كبيرة في تحسين أداء الوكلاء الحسيين (Embodied Agents). ومع ذلك، ركزت الجهود السابقة بشكل كبير على نماذج الصور المعتمدة، والتي تعاني من قيود عملية، خاصةً في إعدادات واجهات المستخدم الرسومية (GUI) حيث يكون التنبؤ بالعنصر المرئي المعقد أمرًا صعبًا. في هذه الدراسة، نستكشف صياغة بديلة لنمذجة العالم لوكلاء (GUI)، حيث يتم وصف انتقالات الحالة باستخدام اللغة الطبيعية بدلاً من التنبؤ بالبكسلات الخام.

نقدم لكم نموذج MobileWorldBench، وهو معيار جديد يقيم قدرة نماذج الرؤية واللغة (Vision-Language Models - VLMs) على العمل كنماذج عالمية للوكلاء المحمولين. كما نقدم مجموعة بيانات MobileWorld، التي تتكون من 1.4 مليون عينة وتساعد بشكل كبير في تحسين قدرات نمذجة العالم لنماذج VLMs.

أخيرًا، نقترح إطار عمل جديد يدمج نماذج VLM ضمن إطار التخطيط للوكلاء المحمولين، مما يظهر أن نماذج العالم الدلالية يمكن أن تعود بفائدة مباشرة على الوكلاء المحمولين من خلال تحسين معدلات نجاح المهام. يمكنكم العثور على الشيفرة البرمجية ومجموعة البيانات على الرابط: رابط المشروع.