في عالم الذكاء الاصطناعي المتطور، يٌعتبر تقييم نماذج رؤية اللغة (VLMs) خطوة أساسية نحو تحسين تجربة المستخدم. وقد أظهرت دراسة جديدة تُعرف باسم NoteVQA كيف أن هذه النماذج، رغم تقدمها، تواجه صعوبة في التعامل مع الأسئلة المتعلقة بالصور التي يطرحها المستخدمون بشكل يومي.

على منصة "شياوهونغشو" (Xiaohongshu)، وهي واحدة من أكثر المنصات الصينية شهرة في مشاركة الصور، لا يزال العديد من المستخدمين يلجأون إلى الأشخاص الآخرين للحصول على المساعدة حول الأسئلة البصرية العادية. لذا، قام الباحثون بتجميع 252 سؤالًا من هذه الأسئلة، مقسمة إلى 12 فئة موضوعية و7 نوايا مستخدم، لإنشاء معيار NoteVQA.

كل سؤال يتضمن مرجعًا مختصرًا مستخلصًا من إجابات المجتمع الخبيرة، مع إجابات تم تدقيقها بشريًا تجمع بين الشروحات النصية والأدلة المرئية الداعمة. ومن خلال هذا المعيار، تم تقييم دقة الإجابات القصيرة وجودة الإجابات المتداخلة.

لتسهيل التقييم، قدم الباحثون إطارًا جديدًا يُعرف باسم "AgenticInterleave" يدعم توليد إجابات مدعومة بالاسترجاع، إلى جانب "IVR-12"، وهو مقياس من 12 بعدًا لتقييم المحتوى، والعرض، وجودة الصورة.

تظهر النتائج أن أعلى دقة للإجابات القصيرة عبر 10 نماذج رؤية لغة متقدمة كانت 52.8%، في حين أن إضافة البحث الوكالي إلى نموذج Qwen3.5-397B-A17B زادت الدقة بنسبة 2.0%. وأظهرت النتائج المتعلّقة بالإجابات المتداخلة أن النموذج نفسه تحت إدارة AgenticInterleave حصل على درجة 3.52، في حين كانت درجة المراجع المدققة بشريًا 4.65، مما يبرز الفجوة الكبيرة في جودة المحتوى.

تسلط هذه النتائج الضوء على التحديات التي يواجهها المستخدمون في الحصول على إجابات دقيقة ومرتبطّة بصريًا، مما يستدعي تحسينات أكبر في نماذج رؤية اللغة (VLMs) لتلبية احتياجات الحياة اليومية.