في عالم التكنولوجيا الحديثة، يعد التفكير البصري المستند إلى الصور أحد المجالات المهمة في تطوير الذكاء الاصطناعي. وهنا يأتي دور معيار Hob-VL الذي يعد أحدث إنجاز علمي، إذ يهدف إلى تعزيز القدرة على إيجاد إجابات دقيقة من خلال تحليل الصور.

يحتوي معيار Hob-VL على مهمتين محوريتين: الأولى هي تقييم ما إذا كانت قاعدة Boolean منطقية موجودة في الصورة، والثانية تتعلق بتحديد الكائن الفريد الذي يتوافق مع الشرح البولياني. يشمل المعيار 6000 سؤال موثوق تم التحقق منها من قبل البشر، حيث تم تصميمها لتكون متوازنة بين الأسئلة Yes/No، تغطي 1000 مشهد تم إنشاؤه و46 صورة مصنفة متنوعة.

تتمحور أسئلة معيار Hob-VL حول تحديات تفكير متقدمة تهدف إلى تجاوز الإشارات المحلية الم misleading، مما يتطلب معالجة منطقية معقدة من قبل النماذج. تتراوح دقة الإجابات البوليانية عبر ثماني تشكيلات للنموذج بين 48.52% و50.57%، بينما تصل أقصى نسبة لتحديد الهوية إلى 43.0%. ورغم أن تكوين النموذج المدعوم بالتفكير حقق بعض المكاسب، إلا أنه لا يزال يعاني من أخطاء واضحة وعدم اتساق في النتائج.

Hob-VL يسلط الضوء على تلك التحديات والاستجابة من خلال أجوبة مرجعية قابلة للتنفيذ وتقييمات متطابقة، مما يمثل خطوة جديدة نحو تطور التفكير البصري في مجال الذكاء الاصطناعي.