في عالم الذكاء الاصطناعي، يبرز النظام الجديد PGN (Pangu Navigator) كنموذج مبتكر في مجال التنقل القائم على الرؤية واللغة (Vision-Language Navigation - VLN). يتطلب هذا النظام تقنيات متطورة يمكّن وكيل مدمج من فهم التعليمات باللغة الطبيعية واستنتاج الأفعال من مشاهد بصرية مرتبة زمنياً.

تشمل التحديات الرئيسية في تكيف نموذج لغوي متعدد الوسائط (Multimodal Large Language Model) مع تطبيق الرؤية واللغة التوافق بين الرؤية واللغة، متطلبات الإدخال الزمني المدمج، وتحديد فضاء الأفعال، بالإضافة إلى التدريب المستقر على الأجهزة المستهدفة.

يعتمد PGN على نموذج OpenPangu-7B، ويعتمد التدريب على مرحلتين. في المرحلة الأولى، يتم ضبط محول Q-Former مع مشفّر الصورة EVA-ViT-G/14، بينما تُستخدم المرحلة الثانية لتكييف النموذج المحدد مع مسارات التنقل الخبيرة عبر نوافذ متعددة تضمن أعمارًا زمنية مختلفة.

لقد أظهر PGN نتائج مبهرة تحت تقييمات مفتوحة، حيث حقق نسبة مطابقة للأفعال تبلغ 62.29% ونسبة خالية من الأخطاء تصل إلى 100%. هذه المقاييس تقيس توافق الأفعال مع الخبراء وليس نجاح التنقل المغلق. على الرغم من ذلك، يبقى تقييم تراكم الأخطاء وكفاءة المسار وإكمال الهدف موضوعات للبحث في المستقبل.