تتنامى أهمية نماذج الذكاء الاصطناعي في المجال الطبي بصورة متزايدة، حيث تسهم في توجيه المرضى للإجابة عن أسئلتهم المتعلقة بالأعراض قبل أن يتواصلوا مع الأطباء. في هذا السياق، يظهر معيار CARE-Bench الذي يُعتبر تطوراً في تقييم قدرات هذه النماذج.

يعمل CARE-Bench على تقييم نماذج الذكاء الاصطناعي من خلال نظام مؤلف من أربع فئات متعلقة بالإجراءات الحالية التي يتوجب اتخاذها بعد تشخيص الأعراض. يضم المعيار 500 حالة طبية و1,059 ترويسة لاستكشافات المرضى تم إعادة بنائها من حوارات طبية واستشارات وأسئلة متابعة.

تم تقييم 11 نموذجاً على 269 جولة مختارة، حيث تعددت النتائج وفقاً لمدى الاستجابة. أظهرت الأرقام أن معدل الـ F1، الذي يستخدم لتقييم جودة النماذج، كان منخفضًا (بين 31.2 و50.4) دون وجود أي تحفيز. ومع التوجيه، تحسنت النتائج إلى 46.9 - 63.4، إلا أنه كانت هناك أخطاء كبيرة في تحديد العتبات.

عندما تتطلب الحالة إجراء استفسار إضافي، فإن 33.5% فقط من النماذج أحسنت الاحتفاظ بالخطوة اللازمة. تشير هذه النتائج إلى أن تحديد أوقات الإجراءات ليس مجرد مشكلة تعود فقط إلى التوجيه، بل يتطلب تقييمًا صريحًا قبل الاعتماد على هذه الأنظمة في التطبيقات العملية.