في عالم الذكاء الاصطناعي، تعتبر المــلاحة البصرية (Visual Navigation) أحد القدرات الأساسية التي يجب أن تمتلكها الكائنات المادية (Embodied Agents). ومع وجود تقنيات الملاحة الحالية التي تتنبأ بمسارات الطريق بشكل فعال، إلا أنها غالبًا ما تفتقر إلى الرؤية البصرية الاستشرافية. ولكن الآن، لدينا نموذج UniNav الذي يمثل خطوة ثورية في هذا المجال.

يعتبر UniNav نموذجًا موحدًا يعتمد على عملية انتشار (Diffusion Process) واحدة، حيث يستطيع توليد الملاحظات البصرية المستقبلية ومسارات النقاط (Waypoints) المستمرة بشكل متكامل. بالاعتماد على إطار توزيع موحد، يدمج UniNav بين عملية إزالة الضجيج للملاحظات البصرية والنقاط، مما يسهل عملية التنبؤ بالمستقبل وتوليد الأعمال ضمن إطار عمل مشترك.

أحد المميزات الرائعة في UniNav هو إضافته لرموز الكاميرات المدركة للهندسة، مما يحسن من أساسيات التنقل في البيئات المختلفة. تم تدريب النموذج على بيانات Navigation مع مسارات محددة وأيضًا على مقاطع فيديو فقط، مما يتيح للنموذج الاستفادة من مقاطع الفيديو المتنوعة حتى دون الحاجة لتسجيل نقاط الطريق.

يمتاز UniNav بنموذجين فرعيين: النموذج الكامل UniNav-Full الذي يتنبأ بالملاحظات المستقبلية الواضحة مع مساراتها، ونموذج UniNav-Fast الذي يعمل على إزالة معلومات الصور المستقبلية أثناء الاستدلال لتحقيق كفاءة عالية في التنبؤ بالمسارات. أظهرت التجارب على مقاييس الملاحة أن UniNav يتفوق على أفضل النماذج الأساسية بمعدل خطأ متوسط (ATE) عبر جميع مجموعات البيانات.

مع زمن استجابة يصل إلى 0.1 ثانية، يوفر النموذج UniNav-Fast أداءً متميزًا دون انخفاض كبير في الدقة، مما يجعله خيارًا مثاليًا للتطبيقات المتنوعة. ومن المثير للاهتمام أن كود النموذج سيتم إصداره ليمكن المطورين والباحثين من الاستفادة منه وتطبيقه.

ما رأيكم في هذا التطور في تقنيات الملاحة البصرية؟ شاركونا أفكاركم في التعليقات!