تُعد معالجة الأسئلة الطبية (Medical Visual Question Answering - VQA) واحدة من المهام الحيوية في مجال الذكاء الاصطناعي السريري، إلا أن التقييم في هذا المجال كان يركز حتى الآن بشكل شبه حصري على اللغة الإنجليزية، مما يحد من فائدته للمرضى والأطباء الناطقين باللغات الأخرى.

في الآونة الأخيرة، كشفت المعايير الجديدة لتقييم VQA الطبي متعددة اللغات أن النماذج الكبيرة للرؤية واللغة (Large Vision-Language Models - LVLMs) تعاني من تدهور واضح في الأداء عند التعامل مع اللغات غير الإنجليزية. ومع ذلك، لم يكن هناك تحليلات دقيقة حول كيفية تأثير الاختلافات اللغوية على القدرات المميزة المطلوبة لمهمة VQA الطبية.

لهذا الغرض، قام الباحثون بإنشاء معيار جديد لـ VQA الطبي متعدد اللغات يغطي ثماني لغات، مُنظّمة في أربعة سيناريوهات تمثيلية تُبرز القدرات الأساسية المطلوبة في هذا المجال. من خلال تقييم خمسة نماذج LVLMs مفتوحة ومغلقة المصدر، توصل الفريق إلى أن تدهور الأداء اللغوي ليس متماثلًا بل يعتمد بشكل كبير على السيناريو المستخدم.

لذلك، تم اقتراح أسلوب جديد يُدعى MedVL-XLRepE، وهو طريقة هندسة تمثيلية تدرك السيناريوهات دون الحاجة إلى تدريب، حيث تستفيد من قدرة LVLMs المتفوقة في VQA الطبي باللغة الإنجليزية، لتوجيه التمثيلات غير الإنجليزية نحو نظيراتها الإنجليزية أثناء عملية الاستدلال.

أظهرت النتائج أن MedVL-XLRepE مكّنت من تقليل التدهور اللغوي عبر ثلاثة نماذج LVLMs وثماني لغات، مع تحقيق زيادات تصل إلى 6.33%.