في عالم الذكاء الاصطناعي، تعتبر دقة المعالجة الطبية عاملاً أساسياً، وقد تم تقديم حل جديد في هذا المجال من خلال معيار CliniCARE-Bench (تقييم دقيق للذكاء الطبي في السجلات الصحية الإلكترونية). يمثل هذا المعيار إنجازًا بارزًا في محاولة دمج الذكاء الاصطناعي بشكل موثوق في الخدمات الطبية.

يعتمد معيار CliniCARE-Bench على استخدام نماذج لغوية ضخمة (Large Language Models)، التي تمتاز بأدائها القوي في معايير المعرفة الطبية. لكن التحدي يكمن في ضمان أن هذه الأنظمة ليست فقط قادرة على معالجة المعلومات، بل أيضًا القيام بتحقيقات دقيقة عن السجلات المعقدة والطويلة الزمن.

تم تصميم CliniCARE-Bench ليحتوي على 25 سيناريو تم التحقق منها من قبل أطباء محترفين، ممثلة في 750 حالة طبية محددة من بيانات حقيقية مأخوذة من قاعدة بيانات MIMIC-IV. تقوم الأنظمة بالتحقق من كل حالة من خلال بيئة أدوات مسجلة ومراقبة تسهل استرجاع السجلات والحسابات وإمكانية الوصول إلى السياسات.

تُصدر الأنظمة أحد أربعة أحكام: "نعم"، "لا"، "غير محدد: نقص في البيانات"، أو "غير محدد: غموض طبي"، مما يفرق بين عدم توفر الأدلة والعمليات الطبية الغامضة. هذا التقييم لا يتوقف عند دقة الحكم، بل يشمل أيضًا تقييم العلاقة بين الأدلة والسياسات التي تم استخدامها، والامتثال العملياتي، والكفاءة. وعلى الرغم من أن دقة الأنظمة تمتد من 65.3 إلى 76.1%، فإن الدقة "الخالية من العيوب"، التي تعزو الحكم فقط عند صحته وخلوه من الأخطاء، تُظهر نتائج أفضل بكثير.

يعتبر CliniCARE-Bench تطورًا فريدًا من نوعه حيث يجمع بين تقييم سير العمل الطويل في السجلات الطبية، واستناد الأدلة على مستوى القضية. يعد هذا المعيار فرصة حقيقية لتحسين نظامي الذكاء الاصطناعي في المجال الطبي وتعزيز ثقة المتخصصين في قدرة الذكاء الاصطناعي على تقديم قرارات طبية موثوقة.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.