في خطوة مذهلة نحو دمج الذكاء الاصطناعي مع تطبيقات الروبوتات، قدم فريق من الباحثين نموذج Show-Harness، الذي يمثل قفزة نوعية في استخدام نماذج الرؤية واللغة (VLMs) للتحكم في الروبوتات. على الرغم من الذكاء الواسع الذي تتمتع به هذه النماذج، كانت ترجمة هذا الذكاء إلى سيطرة فعلية على الروبوتات تحدياً كبيراً.
يعمل Show-Harness كواجهة حيوية تمكن نماذج VLMs من "اللعب" كروبوتات من خلال ربط النية بالأفعال عبر واجهة دلالية مدمجة. مما يميز هذه التقنية هو أنها تعرض وحدات عمل دلالية منفصلة يمكن لنماذج VLMs التفكير بها بشكل طبيعي، بينما تقوم المفسرات الخاصة بالتمثيل بأرضيتها بشكل حاسم في أفعال الروبوتات المحلية. وهذا يعني أن نموذج VLM يكون مسئولاً مباشرة عن قراراته البدنية الدقيقة.
ومن خلال نفس الواجهة، يظهر Show-Harness إمكانية فتح نماذج VLM مغلقة المصدر من أجل التحكم في الروبوتات دون الحاجة لمزيد من التدريب المعقد. كما يمكن تعديل نماذج VLMs مفتوحة المصدر على نطاق صغير للنشر بتكاليف منخفضة باستخدام بضع ساعات من fine-tuning على وحدات معالجة الرسوم (GPU).
بالإضافة إلى ذلك، طور الفريق واجهة GUMI (Graphical User Manipulation Interface) التي توسع نفس مساحة العمل الدلالية لجمع العروض المبنية على واجهة المستخدم الرسومية، مما يسمح للبشر والوكلاء "باللعب" كروبوتات عبر تمثيلات متعددة دون الحاجة إلى أجهزة تحكم عن بعد متخصصة.
تظهر التجارب الواسعة أن وكلاء VLM المزودين بـ Show-Harness يقدمون أداءً ممتازًا عبر مهام متعددة، وتمثيلات وبيئات متنوعة، متفوقين على النماذج التقليدية لوكلاء VLA. تشير هذه النتائج إلى أن الواجهة الصحيحة يمكن أن تفتح قدرات ملموسة من نماذج VLM الأساسية دون الحاجة إلى قدرة نموذجية إضافية أو تدريب مكلف.
ما رأيكم في هذه التطورات الجديدة في مجال الروبوتات والذكاء الاصطناعي؟ شاركونا في التعليقات!
شاهدوا كيف يمكن لوكلاء VLM اللعب كروبوتات باستخدام Show-Harness!
تقدم Show-Harness واجهة مبتكرة تربط بين الذكاء اللغوي المرئي وتنفيذ الأوامر الروبوتية، مما يتيح لوكلاء نماذج VLM أداء مهام معقدة بكفاءة. هذا التطور يعد خطوة هائلة في مجال التحكم في الروبوتات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
