في وقت تتزايد فيه إمكانيات نماذج الرؤية-اللغة (Vision-Language Models) في فهم الصور الطبية، تبرز الحاجة إلى معيار موحد يقيم فعالية هذه النماذج في مجال طب العيون. ولتلبية هذه الحاجة، تم تقديم مشروع EyeVQA الذي يعد أحدث ما توصلت إليه الأبحاث في هذا المجال.

تسهم EyeVQA في تقييم شامل لنماذج الرؤية-اللغة الخاصة بعالم العيون من خلال اعتمادها على 21 مجموعة بيانات مختلفة مصممة خصيصاً لمجموعة متنوعة من الأمراض البصرية. يتضمن المشروع 20,000 مجموعة سؤال وإجابة تغطي ست مجموعات مرضية وأنواع تساؤلات متعددة، مثل اختيار فردي واختيار متعدّد، مما يسمح بتحليل دقيق لأداء النماذج.

الجدير بالذكر أن 44.5% من الأسئلة تتطلب التفكير عبر صور متعددة، ما يمثل تحدياً إضافياً للنماذج التقليدية التي تقيم الصور الفردية فقط. لقد تم تقييم 14 نموذجاً يمثلون مجموعة متنوعة من التطبيقات، إلا أن أفضل أداء تم تسجيله لم يتجاوز 62.8%، مما يبرز الثغرات في الفهم المكاني والعمليات متعددة المهام.

تؤكد نتائج EyeVQA على الحاجة إلى تطوير نماذج أكثر موثوقية وقادرة على التعامل مع البيانات المتعددة المعقدة. يعتبر هذا المشروع محط اهتمام كبير للباحثين والممارسين في مجال الرعاية الصحية، حيث يوفر أسساً جديدة لتحسين دقة التشخيصات المرتبطة بالعيون. لمزيد من التفاصيل، يمكنكم زيارة الصفحة الرسمية للمشروع عبر الرابط مستودع GitHub.

ماذا تعتقدون عن هذا الابتكار الجديد؟ هل يمكن أن يحدث فرقًا في الرعاية الصحية؟ شاركونا آرائكم في التعليقات.