في عالم الرعاية الصحية، لا تقتصر التحديات على دقة التشخيص فقط، بل تمتد إلى كيفية تفاعل الأطباء مع المرضى. هنا يأتي دور KlinikeBench، المعيار الجديد الذي يعيد تقييم أداء نماذج اللغة (Language Models) في البيئات السريرية.

تم تطوير KlinikeBench استجابة لعدم كفاية المعايير الحالية التي تركز فقط على دقة التشخيص، حيث أن المرضى غالبًا ما يقدمون معلومات في صيغات مختلفة. يتطلب الأمر من الأطباء جمع التاريخ الطبي المناسب وتحديد الفحوصات اللازمة قبل الوصول إلى تشخيص. ومن هنا، فإن الاعتماد على دقة التشخيص فقط لا يكفي لتحديد ما إذا كان النموذج قد جمع المعلومات الضرورية أو أجرى تقييمًا سريريًا مناسبًا.

يضم KlinikeBench 333 مهمة تم تأليفها بواسطة أطباء ممارسين، حيث يتم تقديم كل مهمة في بيئة افتراضية مخصصة تتضمن مريضًا افتراضيًا وأدوات سريرية ومعايير نجاح محددة. ومن المثير للاهتمام أن أكثر من 35 متخصصًا قاموا بالمساهمة في تأليف الحالات وتقييم معيار التقييم.

في دراسة تجريبية، أظهر الأطباء أن الحوارات المحاكية كانت ذات تصنيف جودة أعلى مقارنةً بالمحادثات المرجعية. لكل مهمة، تحصل نماذج اللغة على ميزانية محددة من الوقت للتواصل مع المريض، وطرح الأسئلة حول التاريخ الطبي، وطلب الفحوصات، وتسجيل التشخيص النهائي. يتم تقييم هذه الخطوات بشكل فردي وجمعي.

وعبر 31 نموذجًا وسبع عائلات من النماذج، حققت النماذج الأكثر أداءً مثل GPT-6-astra وClaude Opus 5 نجاحًا أقل من 30% من المهام، على الرغم من وصول دقة التشخيص إلى 90.7%. قد تستفيد بعض النماذج من التواصل مع المريض، بينما تُظهر أخرى أداءً قويًا عند التعامل مع معلومات كاملة ولكن تعاني في المحادثة.

بشكل عام، يوفر KlinikeBench منصة لتقييم التفاعل السريري بالكامل ويكشف عن فجوة كبيرة بين دقة التشخيص وأداء التقييم السريري التفاعلي. كيف تعتقد أن هذه المعايير الجديدة ستؤثر على مستقبل تكنولوجيا الذكاء الاصطناعي في مجال الرعاية الصحية؟ شاركونا آراءكم في التعليقات!