تواجه مهام التحكم المتنقل على المدى الطويل تحديات كبيرة تتمثل في الأخطاء المتراكمة أثناء التنفيذ والتداخل بين الحركة والسيطرة. بينما تميزت نماذج ''اللغة والرؤية والفعل'' (Vision-Language-Action) في المهام قصيرة المدى، فإنها تفتقر إلى القدرة على التفكير الهرمي اللازم لتحقيق الأهداف متعددة المراحل.

بالإضافة إلى ذلك، تعاني الوكلاء الهرميون الحاليون من صعوبة في تحديد المهام الفرعية وإعادة التخطيط المرن. لمواجهة هذه القيود، تم تقديم MobiAgent - إطار عمل مزدوج الحلقة يربط ما بين التنفيذ المتين والتحسين الذاتي للسياسات.

خلال عمليات النشر، يقوم MobiAgent بفصل التفكير العالي المستوى عن التحكم المنخفض المستوى من خلال مهارات ذرية قابلة للتجميع. ويتم استخدام نماذج لغة الرؤية لتخطيط الأفق القريب والتأمل البصري، مما يضمن تعيين المهارات بشكل ديناميكي والتعافي من الأخطاء. هذه المهارات يتم تنفيذها بواسطة خبراء متخصصين يتشاركون في بنية تحتية موحدة لأطر عمل اللغة والرؤية، مما يزيد من إمكانية إعادة الاستخدام ويقلل من التداخل.

على الجانب الآخر، يدير MobiAgent التعلم الذاتي المستمر من خلال تقسيم وتحقق تلقائي من نشر العمليات، مما يساعد في اكتشاف المهارات الذرية وتحسين مكتبة المهارات باستمرار دون الحاجة لتدخل بشري.

تظهر التقييمات على RoboCasa وBEHAVIOR-1K ومهام العالم الحقيقي فعالية MobiAgent، حيث تفوق أداؤه على النظام السابق بنسبة 22.5 نقطة في BEHAVIOR-1K، مما يضمن استعادة فعالة من الأخطاء التنفيذية. من خلال إعادة تدوير البيانات الذاتية، ارتفع النجاح من 7.50% إلى 27.50% في RoboCasa ومن 32.5% إلى 57.5% في Astribot S1.

هل تعتقد أن MobiAgent سيكون له تأثير كبير على مستقبل التحكم المتنقل؟ شاركونا آراءكم في التعليقات.