هل تساءلت يومًا كيف يُمكن للذكاء الاصطناعي أن يُساير عقولنا عند رصد المعلومات المرئية؟ في دراسة حديثة نُشرت على arXiv، أظهرت نماذج رؤية-لغة مثل Qwen3-VL-32B-Thinking وGemma-4-26B-A4B-it نتائج مذهلة تتخطى ما كنا نعتقد!
ركز الباحثون على كيفية تأثير الأهداف في توجيه الانتباه البشري، وتم اختبار هاتين النماذج على 4,887 مشهدًا طبيعيًا باستخدام تعليمات بحث بصري وتحرير حر. النتائج كانت مثيرة للإعجاب؛ حيث أظهرت النماذج توافقًا أكبر مع تفاعلات البشر عندما كانت الأهداف متطابقة. هذه الظاهرة استمرت حتى في المشاهد التي لم يوجد فيها أهداف، ما يُبرز قدرة الذكاء الاصطناعي على محاكاة الانتباه البشري بشكل مثير.
بالإضافة إلى ذلك، كان هناك تفاعل مع البنية الدلالية للأهداف أثناء البحث، مما يُظهر عمق الفهم الذي تمتلكه هذه النماذج رغم عدم حصولها على تدريب خاص على gaze. هذا البرنامج يُبهج قلوب الباحثين، حيث يوفر أدوات مُقاسة تتنبأ بمكان نظر البشر بناءً على الأهداف.
هل تظن أن هذه التطورات ستحدث ثورة في طريقة تعاملنا مع المعلومات؟ شاركونا آراءكم!
اكتشاف مثير: نماذج رؤية-لغة تتفاعل بذكاء مع أهداف البشر!
تُظهر نتائج جديدة أن نماذج رؤية-لغة (Vision-Language Models) قادرة على محاكاة انتباه البشر بطريقة غير مُشرفة. البحث يُسلط الضوء على تطور لا يُصدق في طريقة تفاعل الذكاء الاصطناعي مع المعلومات المرئية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
