في خطوة متقدمة تعيد تشكيل مشهد تحليل الصور الطبية، تم إطلاق معيار PathAgentBench الذي يركز على تقييم نماذج الذكاء الاصطناعي المخصصة للسعي للحصول على الأدلة في الصور الكبيرة كليًا (Whole-Slide Images). يعتمد هذا المعيار على أربعة مجالات رئيسية تشمل:

1. **مطابقة الصورة للنص**: للمساعدة في تفسير الأدلة.
2. **استرجاع النص للصورة**: للتحقق من الأدلة.
3. **تحديد المناطق التشخيصية**: لتوفير الأدلة بشكل دقيق.
4. **التفكير متعدد المقاييس**: لدمج الأدلة بشكل فعّال.

يتميز PathAgentBench بشجرة تشخيصية ترتبط بالمناطق المتداخلة عبر مقاييس متعددة مع النتائج المحددة بالمقياس والتشخيصات على مستوى المسار. يشمل المعيار 1,822 صورة TCGA و17,135 مسارًا تشخيصيًا مميزًا من قبل عشرة خبراء معتمدين في علم الأمراض.

كما تم استخدام مجموعة خاصة من 190 صورة لسرطان الثدي مع تعليقات تفصيلية لتقييم استكشاف الكيفية الذاتية للشرائح الكاملة. في تقييمنا، قمنا بفحص 20 نموذجًا عامًا وطبيًا ونماذج متخصصة في علم الأمراض، حيث حققت النماذج الرائدة نتائج دقة تفوق 93% في التفكير متعدد المقاييس و50% في مهام المطابقة بين النماذج.

ومع ذلك، تطل الواجهة الحالية لتحديد المناطق التشخيصية كأحد التحديات الكبيرة: حيث تبين أن أفضل معدل للأداء البالغ عن المناطق الرئيسية أقل من 0.09، مما يشير إلى فجوة ملحوظة بين القدرة على التفكير في الأدلة المنسقة والقدرة على الحصول على تلك الأدلة مباشرة من الصور الكبيرة.

بلا شك، يوفر PathAgentBench إطارًا موحدًا لقياس وتحسين نماذج الذكاء الاصطناعي التي تسعى للحصول على الأدلة في المجال الطبي. في ضوء ذلك، ما هي آراءكم حول كيفية تقدم هذه النماذج في المستقبل؟ شاركونا في التعليقات!