تتطور التقنية يومًا بعد يوم، ومع تقدم نماذج الرؤية- اللغة (Vision-Language Models) بشكل متسارع، تسعى الأبحاث الحديثة إلى تلبية احتياجات الأبعاد الثلاثية. في هذا الإطار، أعلن باحثون عن تطويرهم لإطار عمل جديد تحت اسم VLM-IE3D، والذي يهدف إلى تحسين الوعي المكاني ثلاثي الأبعاد لنماذج الرؤية- اللغة.

تواجه النماذج الحالية تحديات عديدة عند التعامل مع المهام التي تتطلب فهمًا دقيقًا للأبعاد الثلاثية، وهذا ما لذا تم العمل على VLM-IE3D الذي يخول تلك النماذج من استخدام كل من الهندسة الضمنية (Implicit Geometry) والهندسة الصريحة (Explicit Geometry) المُستمدة من مقاطع الفيديو الملونة (RGB).

يُقدم VLM-IE3D مفهومًا جديدًا من خلال رموز الهندسة الضمنية (Implicit Geometry Tokens)، والتي تلتقط القيم الهندسية الأساسية من مقاطع الفيديو. بالإضافة إلى ذلك، يحتوي الإطار على رموز الهندسة الصريحة (Explicit Geometry Tokens) التي تحتفظ بالهياكل الهندسية التفصيلية التي تم إعادة بنائها.

وبجانب ذلك، يتضمن VLM-IE3D مُحولًا يدرك الأبعاد الثلاثية (3D-aware adapter) الذي يمزج بشكل فعال بين نوعي التمثيلات الهندسية مع الإشارات البصرية ثنائية الأبعاد. ويمتاز تصميمه بأنه يعتمد فقط على معلومات RGB، مما يعزز من الفهم المكاني الدقيق لهذه النماذج.

أظهرت التجارب الواسعة أن VLM-IE3D يحقق أداءً متفوقًا في مجموعة متنوعة من المهام ثلاثية الأبعاد، بما في ذلك الكشف في الفيديو ثلاثي الأبعاد، وتأصيل الرؤية الثلاثية، وبناء التوضيحات الكثيفة، واستنتاج الفضاء.

تستعد هذه التقنية الجديدة لإحداث ثورة في الطريقة التي تعمل بها نماذج الرؤية- اللغة، مما يوفر أدوات قوية للبناء في واقع ثلاثي الأبعاد بصورة أكثر دقة. لمعرفة المزيد عن الكود والنماذج يمكنك زيارة الرابط: [الرابط].

ما رأيكم في هذا التطور الجديد؟ شاركونا أفكاركم في التعليقات!