في عالم يتقدم بسرعة نحو الأتمتة والذكاء الاصطناعي، قدم باحثون من arXiv نموذجًا متجددًا يعرف باسم HiWE (Hierarchical World Knowledge Model with Visual Keypoint Enhancement). يعتمد هذا النموذج على نظام مبتكر يتولى مهمة توليد عرض تفاعلي للروبوتات دون الحاجة إلى تدريب محدد مسبق.

تعد عملية توليد عرض تفاعلي للروبوتات معقدة، حيث يجب أن تتضمن تحديد المواقع المناسبة للتفاعل، وتخطيط حركات ممكنة، وتنفيذ عمليات الاتصال الضرورية. وهنا يأتي دور HiWE، حيث يقوم بربط هذه القرارات من خلال واجهة تعتمد على النقاط بين السياق البصري والتخطيط اللغوي.

من خلال استخدام نموذج PointVLM الذي تم تدريبه على المهام، يتم ربط الأجسام الهامة بإحداثيات الصور باستخدام مجموعة متنوعة من العلامات المرئية، وعينات مشتقة من تقسيم المشهد، وملاحظات الروبوت، وبيانات الأسئلة البصرية. تساهم قياسات العمق في تحويل هذه التوقعات إلى تمثيل ثلاثي الأبعاد دلالي، مما يسهل على الروبوت فهم البيئة المحيطة به.

تقوم خوارزمية التخطيط اللغوي، المعروفة بـ 3DLLM، باستخدام هذا التمثيل لتحديد نقاط النهاية وأوامر القبضة للروبوت، بينما يتولى نموذج الالتقاط الهجين تحسين اتجهات القبض.

تم تقييم النموذج على 14 مهمة محاكاة مختلفة وأربع مهام للروبوتات الفيزيائية، مع إجراء دراسة للأثر الناتج عن بيانات التدريب البصرية، والمدخلات المكانية، واختيارات القبض. Surprisingly, يمكن تنفيذ هذا النموذج في سياقات جديدة دون الحاجة لتدريبات معينة مسبقًا!

تمثل هذه الابتكارات في نموذج HiWE طفرة جديدة في كيفية تفاعل الروبوتات مع البيئات المعقدة، مما يعزز من قدرتها على أداء مهام متعددة بكفاءة أعلى.

ما رأيكم في هذا التطور المذهل في عالم الروبوتات؟ شاركونا في التعليقات!