تعتبر نماذج الرؤية واللغة الكبيرة (Large Vision-Language Models) من أبرز الابتكارات في مجال الذكاء الاصطناعي، حيث حققت تقدمًا كبيرًا في أداء المهام البصرية المتنوعة. ومع ذلك، لا تزال هذه النماذج تواجه تحديات في إعادة بناء الهيكل ثلاثي الأبعاد للمشاهد، وهو ما يُعرف بالذكاء المكاني. تعد القضايا مثل إجابة الأسئلة المتعلقة بالفضاء في المشاهد الحقيقية ضرورية، إلا أن إنشاء بيانات وملاحظات هندسية كثيفة يعد عملية مكلفة وتستغرق وقتًا.

في إطار سعيها لمعالجة هذه الفجوة، تقدم هذه الدراسة الجديدة مفهومًا مبتكرًا مستوحى من تطور الإدراك البشري، حيث يتم تعليم المهارات الأساسية للمساحة من خلال مهام هيكلية. تمثل مجموعة بيانات SpatialBlock-15k حلاً مثيرًا، إذ تحتوي على 15,000 مشكلة تكديس كتل، مما يغطي مشكلات التحويل من 3D إلى 2D وتغيير زوايا الرؤية، بالإضافة إلى دمج الهيكل.

تتضمن مجموعة البيانات أيضًا ت modulation لوني مُتحكم فيه، مما يزيد من تعقيد المشهد البصري ويشجع على التفكير المنطقي بناءً على نقاط مرجعية. أظهرت التجارب أن نماذج الرؤية واللغة المدربة باستخدام مجموعة البيانات هذه تتفوق بشكل كبير على المعايير السابقة، مما يزيد من قدرتها على التعرف على المهام المكانية الواقعية، بالرغم من طابعها الاصطناعي والمركب.

للمزيد من التفاصيل، يمكن للمهتمين زيارة الصفحة الرسمية على GitHub. ما رأيكم في هذا التطور الكبير في نماذج الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!