في عالم الذكاء الاصطناعي المتطور، يعد نموذج الانتقال البصري المدعوم باللغة (Language-Conditioned Visual Navigation - LCVN) تطورًا مثيرًا. من خلال هذا النموذج، يمكن للروبوتات اتباع التعليمات اللغوية دون الحاجة إلى صور الأهداف، مما يجعلها تعتمد فقط على الإدراك اللغوي والتحكم المستمر.

طُورت مجموعة بيانات LCVN، التي تتضمن أكثر من 39,000 مسار و117,000 تعليمات تم التحقق منها بواسطة البشر، لتكون مرجعاً قيماً لدراسة كيفية تفاعل الآلات مع اللغات الطبيعية. يستخدم النموذج أسلوبين رئيسيين: التعلم عبر السياسة المدعوم بالخيال (Latent-Imagination Policy Learning) والتنبؤ التلقائي الموحد (Unified Autoregressive Prediction)، حيث يقوم الأول بتوقع ملاحظات مستقبلية، بينما الثاني يعالج جميع التنبؤات في خطوة واحدة.

تشير التجارب إلى أن النموذج الجديد يقدم ميزات تكاملية، حيث يوفر الخيال المتخيل نتائج أكثر اتساقًا زمنياً في حين أن التنبؤ الموحد يمكن أن يعمم بشكل أفضل على البيئات غير المرئية. كما تسلط الدراسات الضوء على كيفية تأثير التعليمات اللغوية وأسلوب التعليمات على أداء الروبوتات.

بهذه الطريقة، يؤسس نموذج LCVN أساسًا للدراسات المستقبلية حول تفاعل اللغة والخيال واتخاذ القرار في الأجهزة الذكية، مما يغير الطريقة التي نتفاعل بها مع التكنلوجيا.