في ظل التقدم السريع الذي تحققه نماذج اللغات الضخمة متعددة الوسائط (MLLMs) في مهام الرؤية-اللغة ثنائية الأبعاد، لا يزال الاستدلال المكاني متعدد النظرات يشكل تحدياً كبيراً. هذا التحدي يعود إلى عدم وجود مسارات معرفية ثلاثية الأبعاد منظمة في مجموعات البيانات الحالية، مما يؤدي إلى ضعف في الفهم المكاني.

لإيجاد حل لهذه المشكلة، تم تقديم مجموعة بيانات MV-STRIDE، التي تعني (Multi-View hierarchical SpaTial Reasoning dataset with Interdependent and DEcomposed capabilitiEs). هذه المجموعة ليست مجرد بيانات مسطحة، بل تقوم بشكل صريح بنمذجة العلاقات الاعتمادية بين الإدراك الأساسي وفهم المشهد والاستدلال السياقي المعقد. مما يوفر مسار تعلم متماسك يواكب الإدراك المكاني البشري.

يعتمد التصميم على نظام متكامل لتوليد الأسئلة، مستفيداً من مصادر المشاهد ثلاثية الأبعاد المتنوعة، مما يفرض قيوداً على الاعتمادية عبر النظرات المختلفة لمنع حل المسألة من منظور واحد. تمتد المهام المعقدة في الاستدلال المكاني لتشمل إشرافاً مدعوماً بسلاسل تفكير قائمة على المعرفة.

أظهرت التقييمات الشاملة أن إطار التدريب متعدد المراحل، القائم على مجموعة البيانات الهرمية الجديدة، يحقق أداءً متفوقاً في عدة مقاييس للاستدلال المكاني، خاصة معيار MMSI-Bench المتجه نحو الاستدلال متعدد النظرات. بفضل هذا النهج، تستطيع نماذج (MLLMs) الحفاظ على استدلال مكاني قوي ومتسق ثلاثي الأبعاد عبر وجهات نظر متنوعة. يمكنكم الاطلاع على الكود ومجموعة البيانات من خلال الرابط: https://co1dspring.github.io/MV-[STRIDE/].

ما رأيكم في هذه التطورات المذهلة في الذكاء الاصطناعي؟ شاركونا في التعليقات!