مع التقدم السريع في نماذج الرؤية-اللغة (Vision-Language Models - VLMs)، تظهر إمكانيات رائعة في مجال علم الأمراض الحاسوبي. ومع ذلك، لم تُحقق عملية توليد التقارير الطبية بناءً على الصور الشاملة (Whole-Slide Images - WSI) القفزات المطلوبة بسبب نقص مجموعات بيانات WSI الكبيرة والمعقدة. لذا، فكر الباحثون في ابتكار مجموعة بيانات جديدة تضم بيانات طبية حقيقية.

نستعرض في هذا المقال مجموعة بيانات تم تنسيقها بدقة تضم حوالي 10,500 زوج من البيانات من خمس مؤسسات طبية، والتي تهدف إلى تحسين نماذج الذكاء الاصطناعي في هذا المجال. بالإضافة إلى ذلك، تم تحديد معيار REG 2025 من خلال تحدي MICCAI للتقييم النظامي لنماذج الوسائط المتعددة.

تشمل الطرق المقدمة في التقييم نماذج VLMs المدربة مسبقًا، وإطارات التعلم متعددة الحالات، والنماذج الخبيرة الهرمية، وتوليد المعزز بالاسترجاع، والمحولات بين الوسائط. لكن النتائج تُظهر أن أداء النماذج المتفوقة لم يعتمد فقط على استخدام نماذج VLM، بل أيضًا على تمثيلات التقارير المنظمة، والانقسام التشخيصي الهرمي، والتأريض الفعال بين الوسائط.

ومع ذلك، تم تحديد بعض القيود المهمة، مثل عدم الاستقرار في تقدير السمات الكمية (مثل الهلاوس العددية) والاتجاه نحو تحديد تشخيصي تفصيلي يتجاوز الحد المطلوب، مع وجود بعض الأخطاء التي تشبه الأنماط المعروفة في علم الأمراض الروتيني. تُعزز هذه النتائج من أهمية مجموعة بيانات REG 2025، حيث توفر مرجعًا قويًا لتقييم توليد التقارير المنظمة بناءً على الصور الشاملة وفهم نماذج الرؤية-اللغة في علم الأمراض الحاسوبي.

في الختام، تعطي هذه الخطوة المبتكرة أُفقًا جديدًا لتصميم نماذج متعددة الوسائط قائمة على الأسس السريرية، مما يعزز دقة وفاعلية عمليات التشخيص والمراقبة الطبية.