تسعى نماذج الرؤية واللغة (Vision-Language Models) إلى تحقيق أداء قوي في المهام متعددة الوسائط، إلا أن هناك جوانب لم يتم فهمها بشكل جيد، منها إدراك الأعداد، وهو قدرة عقلية تظهر عند الأطفال قبل اكتساب اللغة. في هذا السياق، تم تقديم معيار مبتكر يُدعى NumerosityVLM، والذي يتكون من 10,800 صورة صناعية موزعة عبر ست حالات متحكم فيها.

يعمل هذا المعيار على فصل إدراك العدد عن العوامل البصرية ذات الصلة، من خلال التلاعب بشكل مستقل في حجم الجسم، والترتيب المكاني، وعدد العناصر. وقد تم إجراء تقييم لسبع نماذج رؤية ولغة في سياق صفر-إطلاق (Zero-shot setting)، مما أسفر عن تحليل متعدد العوامل حيث تبين أن تصميم النموذج يفسّر أكبر قدر من التباين في الأداء (partial ω²=0.325)، متجاوزًا بذلك الظروف البصرية.

علاوة على ذلك، يظهر الاستكشاف وفقًا للطبقات أن إشارات الأعداد القابلة للفصل خطيًا تظهر باستمرار في المراحل المبكرة من مشفر الرؤية، فيما يرتبط الاختلاف في الأداء بين النماذج المعنية بشكل رئيسي بمكون نموذج اللغة.

للمزيد من المعلومات، يمكن الوصول إلى الشيفرة والبيانات الخاصة بهذا المعيار عبر الروابط التالية: رابط إلى مستودع GitHub ورابط إلى Hugging Face.