هل تساءلت يومًا كيف يُمكن للذكاء الاصطناعي أن يُساير عقولنا عند رصد المعلومات المرئية؟ في دراسة حديثة نُشرت على arXiv، أظهرت نماذج رؤية-لغة مثل Qwen3-VL-32B-Thinking وGemma-4-26B-A4B-it نتائج مذهلة تتخطى ما كنا نعتقد!

ركز الباحثون على كيفية تأثير الأهداف في توجيه الانتباه البشري، وتم اختبار هاتين النماذج على 4,887 مشهدًا طبيعيًا باستخدام تعليمات بحث بصري وتحرير حر. النتائج كانت مثيرة للإعجاب؛ حيث أظهرت النماذج توافقًا أكبر مع تفاعلات البشر عندما كانت الأهداف متطابقة. هذه الظاهرة استمرت حتى في المشاهد التي لم يوجد فيها أهداف، ما يُبرز قدرة الذكاء الاصطناعي على محاكاة الانتباه البشري بشكل مثير.

بالإضافة إلى ذلك، كان هناك تفاعل مع البنية الدلالية للأهداف أثناء البحث، مما يُظهر عمق الفهم الذي تمتلكه هذه النماذج رغم عدم حصولها على تدريب خاص على gaze. هذا البرنامج يُبهج قلوب الباحثين، حيث يوفر أدوات مُقاسة تتنبأ بمكان نظر البشر بناءً على الأهداف.

هل تظن أن هذه التطورات ستحدث ثورة في طريقة تعاملنا مع المعلومات؟ شاركونا آراءكم!