تعدّ تقنية التنقل عبر الرؤية واللغة (Vision-and-Language Navigation - VLN) خطوة كبيرة في مجال الذكاء الاصطناعي، حيث تتطلب وجود وكيل متجسد قادر على التنقل في بيئات معقدة استنادًا إلى تعليمات لغوية طبيعية. لكن هذه المهمة ليست بالسهلة، إذ تتطلب توافقًا دقيقًا بين الملاحظات البصرية والإرشادات اللغوية.

لتذليل هذه العقبة، تم اقتراح إطار عمل جديد يتمحور حول الإرشاد التوجيهي الدقيق لتحليل الرسوم البيانية (Fine-Grained Instruction-Guided Graph Reasoning - FIGR)، الذي يعزز من كل من التمثيل المكاني وفهم التعليمات خلال التنقل.

يعتمد النظام على آلية تفاعل الرسوم البيانية للملاحظات التي تفكك الإشارات الزاوية والبصرية، بينما تعزز من تمثيلات الحواف الموجهة من خلال تضمين هندسي، مما يمكّن من إجراء استدلال مكاني أكثر موثوقية ضمن الرسم البياني للتنقل.

تتضمن التقنيات الحديثة المُعتمدة في النظام وحدة توجيه تفصيلية يُطلق عليها Adaptive Open Vocabulary Guidance (AOVG)، حيث يقوم محلل السياق بتحديد المواقع والأشياء والعلاقات المكانية والسياقات الأخرى بمرونة.

تساعد هذه الوحدة في تجنب المطابقة الدقيقة للنصوص، ودعم الكيانات والتعبيرات التركيبية غير المعروفة مسبقًا. بالنسبة للتعليمات متعددة اللغات، يُعتمد على مشبك دلالي متعدد اللغات (Multilingual Semantic Adapter - MSA) لتحويل التمثيلات الخاصة باللغة إلى مساحة دلالية مشتركة.

بفضل التكامل بين تحليل الرسوم البيانية الهيكلية مع التعليمات الدلالية الأساسية، فإن هذه الطريقة تعزز بشكل كبير من قدرة الوكلاء على اتباع التعليمات المعقدة للتنقل. وعند تقييم الأداء على بيانات لم تُشاهد سابقًا، حقق نظام FIGR معدل 67 SPL على بيانات R2R و64.8 sDTW على بيانات RxR، متفوقًا بذلك على نظام SPENav بنقطة مئوية واحدة في SPL ونقطتين ونصف في sDTW.