تتمتع نماذج الرؤية-اللغة-العمل (Vision-Language-Action Models) بإمكانيات قوية في مجال التلاعب بالروبوتات، ولكن معظم النماذج الحالية تعتمد على هياكل بصرية-لغوية ثنائية الأبعاد (2D) وتفتقر إلى فهم دقيق للأجسام ثلاثية الأبعاد. هنا يأتي دور إطار العمل الجديد الذي يتمحور حول تمثيلات ثلاثية الأبعاد، حيث تم استخدام SAM3D كمعلم ثابت لتقديم معرفة ثلاثية الأبعاد عن الأجسام المستهدفة أثناء التدريب.

في الإطار الجديد، نقوم بتحديد الأجسام المهمة للمهام باستخدام نماذج التعرف على الأجسام، ونجري بناءً على ذلك أقنعة الأجسام، ومن ثم نستخرج تمثيلات ثلاثية الأبعاد كثيفة مع SAM3D، والتي تتماشى مع الميزات البصرية المتوسطة للنموذج الأساسي ($\pi_0$). هذا يُمكّن السياسة من استيعاب معلومات ثلاثية الأبعاد عن الأجسام المستهدفة مع الحفاظ على سلسلة الاستنتاج التقليدية من RGB إلى اللغة إلى العمل دون الحاجة إلى عمق أو سحب نقاط أو أقنعة أو موديولات ثلاثية الأبعاد إضافية في وقت الاختبار.

تشير التجارب في بيئات المحاكاة إلى تحسن ملحوظ، حيث حققنا 99.1% على مجموعة بيانات LIBERO ومتوسط طول 4.11 على مجموعة بيانات CALVIN. كما أثبتت التجارب في العالم الحقيقي فعالية هذه الطريقة بشكل خاص في سيناريوهات التلاعب الطويلة الأمد، حيث يتوجب على الروبوت التركيز على أجسام هدف مختلفة عبر مهام متعددة. هذا الابتكار يعد خطوة هامة نحو تحسين الأداء الكلي للروبوتات في البيئات المتنوعة.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات!