شهد مجال الذكاء الاصطناعي (Artificial Intelligence) تطوراً مذهلاً في السنوات الأخيرة، حيث أصبحت نماذج اللغات الضخمة (Large Language Models) قادرة على إجراء مهام معقدة تتعلق بالتفكير والتحليل. ومع ذلك، فإن ضمان تطبيق هذه النماذج بشكل آمن وفعال في مجالات الرعاية الصحية يتطلب خطوات واضحة لتقييم أدائها في مهام التشخيص.

تقدّم DiagnosisArena، منصة جديدة تهدف إلى تقييم القدرات التشخيصية للنماذج الحالية. هذه المنصة تم تصميمها لتكون تحديًا شاملاً يقيّم مستوى كفاءة التشخيص وفق معايير محترفة. تشمل DiagnosisArena 1,113 حالة مرضية مقسمة مع التشخيصات ذات الصلة، موزعة على 28 تخصصًا طبيًا، مشتقة من تقارير سريرية منشورة في 10 مجلات طبية مرموقة.

تم تطوير هذه المنصة عبر عملية بناء دقيقة، تشمل عدة جولات من الفحص والمراجعة بواسطة أنظمة الذكاء الاصطناعي وخبراء بشريين، مع إجراءات صارمة لمنع تسرب البيانات.

أظهرت الدراسة قدرة النماذج الأكثر تقدمًا مثل o3 وo1 وDeepSeek-R1 على تحقيق دقة بلغت 51.12% و31.09% و17.79% على التوالي. تشير هذه النتائج إلى وجود عائق كبير في التعميم يواجه النماذج الحالية عند مواجهة تحديات التفكير التشخيصي السريري.

من خلال DiagnosisArena، نسعى لتحفيز مزيد من التطورات في قدرات الذكاء الاصطناعي المتعلقة بالتشخيص، مما يمكّن من إيجاد حلول أكثر فعالية للتحديات التشخيصية في العالم الحقيقي.

للاستفادة من هذه الأداة الرائدة والمساهمة في الأبحاث المستقبلية، يمكنكم زيارة رابط GitHub الخاص بالمشروع. ما رأيكم في هذه المبادرة الثورية؟ شاركونا في التعليقات.