في عصر الذكاء الاصطناعي، باتت الروبوتات قادرة على القيام بمزيد من المهام المعقدة، وبدلاً من أن تكون مجرد أدوات، أصبح هناك اتجاه قوي نحو تطويرها لتكون أكثر فهماً وتفاعلاً مع العالم من حولها. في هذا السياق، تم تقديم إطار عمل مفاهيمي مثير لتدريب نماذج الرؤية واللغة (Vision-Language Models) بهدف تمكين هذه النماذج من القدرة على أخذ منظور بصري (Visual Perspective Taking)، وهو أحد المهارات الأساسية للتفاعل الفعّال بين البشر والروبوتات (Human-Robot Interaction).

كخطوة أولى نحو تحقيق هذا الهدف، تم إنشاء مجموعة بيانات اصطناعية باستخدام منصة NVIDIA Omniverse، لتمكين التعلم المُراقب لمهام الاستدلال المكاني. تتضمن كل حالة صورة RGB، ووصفًا بلغة طبيعية، ومصفوفة تحويل بدقة 4x4 تمثل وضعية الكائن. وتركز الدراسة على استنتاج مسافة المحور Z كمهارة أساسية، مع خطط مستقبلية للتقدم نحو استنتاج كامل لست درجات من الحرية (6 Degrees Of Freedom).

تُعد هذه المجموعة من البيانات متاحة للجمهور لدعم الأبحاث المستقبلية، مما يمثل خطوة أساسية نحو أنظمة الذكاء الاصطناعي المدمجة القادرة على الفهم المكاني في سيناريوهات التفاعل مع البشر.

سؤالنا اليوم هو: كيف تظن أن هذه التقنيات ستؤثر في تطوير الروبوتات القادرة على التفاعل مع المجتمع؟ شاركونا آرائكم في التعليقات!