في خطوة جديدة في عالم الذكاء الاصطناعي، تم تقديم معيار جديد للسؤال والجواب المرئي الطبي باللغة البولندية، مشتق من أسئلة امتحان الشهادة المهنية لباحثي الطب وطب الأسنان. يتضمن هذا المعيار مجموعة متكاملة من الأسئلة التي تحتوي على صور تغطي تخصصات طبية متنوعة ومجالات بصرية متعددة، إلى جانب مجموعة للتحكم تتضمن أسئلة نصية فقط.

عند تقييم النماذج المختلفة، بما في ذلك نماذج رؤى-لغة تجارية ونماذج مفتوحة ذات وزن عام، كانت النتائج محبطة نوعاً ما. فحتى النموذج الأفضل حقق دقة لم تتجاوز 79% في مجموعة VQA الكاملة، فيما يظل النموذج GPT-5.6 هو الوحيد الذي تمكن من تجاوز مساعد بشري في مجموعة فرعية تتضمن استجابات مرشحة.

من المثير للاهتمام أن التقييمات أظهرت أن هذه النماذج تعتمد بشكل أكبر على نص السؤال بدلاً من التفاصيل البصرية في الصورة، مما يشير إلى أن الأداء كان أقل في الأسئلة التي تعتمد على الصور بشكل أكبر. بل وأكثر من ذلك، حتى عند فقدان مكونات رئيسية من المهمة، استطاعت النماذج تحقيق أداء متفوق، مما يدل على أن هناك إمكانية للمحافظة على أداء غير تافه تحت ظروف صعبة.

تسليط الضوء على هذه التحديات يفتح المجال للتفكير: لماذا يعتبر استثمار الأدلة البصرية أقل بالنسبة لهذه النماذج؟ وما الخطوات التالية التي يمكن اتخاذها لتحسين قدراتها في هذا المجال؟