في عالم الذكاء الاصطناعي، يُعتبر **الفهم المكاني** جزءًا أساسيًا من تطوير النماذج اللغوية البصرية (Vision-Language Models - VLMs)، خصوصًا عند استخدامها كنماذج تشتمل على الفعل (Vision-Language-Action - VLA) في البيئات الفيزيائية. ولكن، حتى الآن، كانت المعايير المتاحة تركز بشكل رئيسي على العلاقات البسيطة ذات الخطوة الواحدة، متجاهلةً أهمية العمليات المعقدة متعددة الخطوات.

لذا، نأتي إليكم اليوم بالإعلان عن **MultihopSpatial**، معيار مبتكر مصمم خصيصًا لتقييم **التفكير المكاني متعدد الخطوات**. يتضمن هذا المعيار:

1. **مقياس شامل** يُركز على معالجة الاستفسارات متعددة الخطوات، حيث يتضمن استفسارات تتراوح من واحد إلى ثلاثة خطوات عبر وجهات نظر مكانية متنوعة.
2. **Acc@50IoU**، وهو مقياس مكمل يقيم القدرة على التفكير مع الدقة البصرية من خلال طلب اختيار الإجابة وتوقع الصندوق المحيط بدقة. وهذا ما يجعله أداة حيوية لمزيد من الفعالية عند نشر نماذج VLA.
3. **MultihopSpatial-Train**، وهو قاعدة بيانات تدريب موسعة تهدف إلى تنمية الذكاء المكاني.

من خلال تقييم شامل لــ 37 نموذجًا متقدمًا من VLMs، تم الكشف عن 8 رؤى رئيسية، مما يظهر أن التفكير المكاني المركب لا يزال يمثل تحديًا كبيرًا. والأكثر من ذلك، أثبتت أبحاثنا أن استخدام **تعلم التعزيز** بعد التدريب على هذه القاعدة يعزز من القدرة على التفكير المكاني للنماذج، مما يحسن من أدائها في المهام المعقدة.

في ظل هذه التطورات المثيرة، كيف تعتقد أن سيؤثر معيار MultihopSpatial على مستقبل الذكاء الاصطناعي في تطبيقات الحياة الحقيقية؟ دعونا نتناقش في التعليقات!