في عالم الذكاء الاصطناعي، أصبحت الحاجة إلى وكلاء الاستشارة الطبية متعددة الخطوات أمرًا لا مفر منه، حيث يتعين عليهم اتخاذ قرارات حاسمة بشأن ما يجب السؤال عنه، والتكيف مع استجابات المرضى، وتحديد متى تكون الأدلة المجمعة كافية. لكن التقييم التقليدي غالبًا ما يخلط بين جودة التاريخ الذي يتم جمعه ونتائج التشخيص النهائية، مما يؤدي إلى تشويش المخرجات.

لذلك، تم تقديم MedDDC-Eval، وهو نظام تقييم جديد يفصل بين التشخيص وسجل التفاعل مع المرضى. حيث يتم استخدام مستودع موحد يعالج التاريخ المجمّع كهدف للمقارنة ويحتفظ بخريطة مستقرة للتشخيص، مما يتيح تقييمًا موضوعيًا لكفاءة التفاعل.

تظهر النتائج التجريبية أن تغيير القارئ التشخيصي وحده يمكن أن يؤثر بشكل كبير على النتائج، حيث تشير التغييرات إلى تحسينات تتراوح بين 2.2 و 19.0 نقطة في تقييم F1. هذا، بالإضافة إلى الاستخدام النتائج من 100 حالة مسجلة و70 حالة حوارية، يوضح أن القدرة على تحصيل المعلومات وكفاءة التشخيص يمكن أن تتطور بصورة ملحوظة عند استخدام MedDDC-Eval.

MedDDC-Eval لا يساعد فقط في تحسين دقة التشخيص، بل يوفر أيضًا طريقة متحكم بها للتقييم ويساهم في تطوير سياسات الاستحواذ على الأدلة المتعلمة. في النهاية، يمثل هذا التطور قفزة نوعية في كيفية تعامل الذكاء الاصطناعي مع الرعاية الصحية، ناشئًا عن تقنيات متقدمة تقودنا نحو المستقبل.