تعتبر الملاحة المعتمدة على التعليمات اللغوية البصرية (Vision-Language Navigation) نقطة تحول في كيفية تفاعل الروبوتات مع البشر. ففي السابق، كانت هذه النماذج تعتمد عادةً على الخرائط الملاحية ورؤى بزاوية 360 درجة، مما جعلها غير قابلة للتطبيق بشكل فعال في البيئات الحقيقية. ومع ذلك، فإن العمل الجديد الذي يتناول انتقال النماذج من المحاكاة إلى العالم الحقيقي (Sim-to-Real Transfer) يفتح آفاقًا جديدة.

في هذه الدراسة، يتم تقديم نظام مبتكر يسمح للروبوتات بالتنقل في بيئات مستمرة فقط من خلال التعليمات اللغوية والبصرية، دون الحاجة إلى الاعتماد على الخرائط أو المشاهد البانورامية. يعتمد النظام على نماذج رؤية-لغة تتكامل بين المدخلات البصرية والتعليمات اللغوية في فضاء مشترك، مما يسهل عملية الملاحة المدفوعة باللغة الطبيعية.

تم تدريب نموذجنا باستخدام بنية قائمة على الانتباه المتقاطع (Cross-Modal Attention) على مجموعة بيانات موجودة في بيئة محاكية، ثم تم تحسينه باستخدام بيانات العالم الحقيقي من روبوت مزود بكاميرا وجهاز استشعار LiDAR. من خلال استخدام التعديلات الفوتومترية الخطية والتدريب على عدد محدود من الحلقات، استطاع نموذجنا التكيف مع بيئات العالم الحقيقي وتحقيق ملاحة فعالة أثناء التشغيل على الأجهزة المخصصة.

تُظهر النتائج التجريبية، المقيمة باستخدام قياسات نجاح مسار الخط (SPL) وانحدار الزمن الديناميكي المقنن (nDTW)، متانة وقابلية تكيف مقاربتنا هذه. إن هذا التقدم يمثل خطوة مهمة نحو جعل التفاعل بين البشر والروبوتات أكثر سلاسة وفاعلية.