تعتبر الملاحة اللغوية-الصورية (Vision-Language Navigation - VLN) إحدى أبرز التحديات في عالم الذكاء الاصطناعي، حيث يتطلب من الوكلاء (agents) أن يعتمدوا على التعليمات الطويلة والمعلومات المتاحة من البيئة المحيطة بهم. لكن، ماذا يحدث عندما يكمن الفشل في طريقة تفكيرهم؟

تظهر الأبحاث أن الوكلاء القائمين على نموذج الملاحة اللغوية-الصورية (VLM) يمكن أن يشعروا بالثقة حتى عندما تكون الأدلة اللازمة لإتمام المهمة غير متوفرة، مما يؤدي إلى ما يسمى بـ "قصور التقدم" (Progress Myopia)، حيث يستمر الوكيل في اتخاذ خطوات خاطئة بسبب عدم إدراكه لعدم موثوقية الأدلة المتعلقة بالتقدم.

لمعالجة هذه المشكلة، تم تقديم نموذج SeekVLN، وهو إطار يسعى لجمع الأدلة بشكل نشط أثناء معالجة التقدم في المهام. يتكون تدريب SeekVLN من مرحلتين، حيث يستخدم النموذج "التوليد العكسي الموجه نحو المستقبل" (Future-guided Reverse Generation - FRG)، الذي يستفيد من أفعال الخبراء المستقبلية لإثراء مسارات الملاحة مع رؤى إضافية وتعليقات إثبات.

بعد ذلك، تتبع عملية تحسين سياسية تعاكسية (Counterfactual Contrastive Policy Optimization - C2PO) تهدف إلى تعزيز المنتج النهائي من خلال مقارنة القرارات المختلفة. من خلال هذه الأساليب، تمكنت الأبحاث من تحقيق نتائج غير مسبوقة، حيث حققت النموذج نجاحاً بنسبة 12.7% و7.5% عن النموذج الأساسي في تجارب معايير R2R-CE وRxR-CE.

تظهر التجارب على كل من المعايير المحاكاة والبيئات الحقيقية سلوكيات شبيهة بالبشر في جمع الأدلة، مما يعزز مصداقية نظام الملاحة. يبدو أنه في عالم الذكاء الاصطناعي، "التفكير قبل الحركة" هو مفتاح النجاح.

ما رأيكم في هذه التقنيات الجديدة؟ هل تعتقدون أنها ستحدث ثورة في طريقة الملاحة المعتمدة على الذكاء الاصطناعي؟ شاركونا في التعليقات.