في عالم الروبوتات المتقدم، تظهر نماذج رؤية اللغة-العمل (Vision-Language-Action models) نتائج واعدة في مجال Manipulation. إلا أن التحدي يكمن في ربط الملاحظات البصرية والتعليمات اللغوية بالأفعال الأساسية، مما يؤدي في بعض الأحيان إلى ضعف التفسير وافتقار للمرونة في المهام المعقدة والطويلة الأمد.

لتجاوز هذه العقبات، تم تطوير نموذج غوندولا (Gondola)، والذي يعتمد على إطار عمل modular يعمل على فصل التخطيط على المستوى العالي عن التحكم على المستوى المنخفض. يتميز غوندولا بقدرته على توليد خطط منظمة مع تحديد دقيق لمواقع الكائنات قبل تنفيذ الأفعال.

بمجرد الحصول على ملاحظات متعددة الرؤى وتاريخ التخطيط، يقوم غوندولا بالتنبؤ بالخطة التالية على هيئة تعليمات نصية وأقنعة تقسيم متعددة الرؤى تتوافق مع الكائنات المستهدفة وأماكن الأهداف. ولتدريب غوندولا، تم إنشاء مجموعات بيانات اصطناعية توفر إشرافاً دقيقاً على التخطيط القائم على الأساس القصير الأمد.

بفضل coupling توليد الخطط المنضبطة مع سياسة التنفيذ المبنية على структуриات ثلاثية الأبعاد، حقق هذا النموذج أداءً رفيعاً على معيار GemBench. كما أثبت النظام إمكانية انتقاله الواعدة إلى الروبوتات الحقيقية. أكدت دراسات التباين أن تحديد المواقع على المستوى البكسلي والإشراف التخطيطي المقترح هما مفتاحان رئيسيان لتفعيل reasoning الفعال على المستوى العالي.

اقرأ المزيد عن غوندولا على صفحة المشروع الرسمية: رابط المشروع