في عالَم الذكاء الاصطناعي، يُعتبر التفكير السريري (Clinical Reasoning) أحد العناصر الأساسية التي تمكّن نماذج اللغة الكبيرة (Large Language Models) من التعامل مع السجلات الطبية بفعالية. ولكن، هل يكفي تقييم الدرجات بأسلوب الامتحان لتحديد مدى جودة reasoning في هذه النماذج؟

يُحدد التفكير السريري بأنه عملية دمج وتحديث الأدلة عبر الزمن ومصادر متعددة لتشكيل وتعديل وتبرير تمثيل مشاكل المريض وخطة علاج مبررة. من خلال مراجعة موضوعية منظمة، تم وضع خريطة ثلاثية الأدب تشمل: أدوات تقييم التعليم الطبي، ومعايير تقييم نماذج LLMs المنشورة من عام 2023 فصاعداً، وأساليب عامة لتقييم الإنتاج الطويل.

تناول البحث ستة أبعاد رئيسية: تمثيل المشكلة، التركيب الزمني، التفكير التفرعي والإداري، التفكير المضاد للحقائق، عدم اليقين المصحح، وأمانة reasoning. ومع ذلك، لا يغطي أي من الأدوات المتاحة جميع هذه الأبعاد بشكل شامل. بعض الأدوات مثل TIMER-Eval تستهدف التركيب الزمني، بينما يقيم ER-Reason تحديث المعتقدات التشخيصية التتابعية.

تشير الأدلة إلى أن التفكير الدقيق يحتاج إلى أدوات مخصصة وموثوقة، حيث تتسم بعض الأبعاد مثل الأمانة بضعف ملحوظ. كما أن تقييمات عدم اليقين والتفكير المضاد للحقائق في بداية تطورهم، إلا أن تطبيقها لا يزال محدوداً.

بهذا، يشير البحث إلى ضرورة دمج الأدوات الحالية عبر عناصر نقاط مرجعية ثنائية، مع تسجيلات منفصلة لمستويات الاكتمال والصحة، وتوزيع أهمية متخصصة للحالات، مما يعزز من دقة التقييم في هذا المجال الحيوي.

تحتاج هذه الأدوات إلى تصميم إضافي في مجالات عدم اليقين المصحح والتفكير المضاد للحقائق وأمانة reasoning، وهذا الاستعراض يعتبر دليلاً تصميمياً وليس أداة موثقة.