في عالم الرعاية الصحية المتطور، يُظهِر الذكاء الاصطناعي تحولاً كبيرًا من مجرد الإجابة على الأسئلة إلى أنظمة وكيلية تتفاعل مع المرضى، وتستند إلى سجلاتهم الصحية، وتعمل نيابة عنهم. ومع تطور هذه الأنظمة، أصبح من الضروري تقييم فعاليتها لضمان الأمان الدقيق. ولهذا الغرض، تم تقديم معيار جديد يحمل اسم PatientAgentBench، والذي يهدف إلى قياس أداء وكلاء الذكاء الاصطناعي في التعامل مع المرضى.

تركز معظم المعايير الحالية على المعرفة الطبية عبر مهام تفاعلية، لكن PatientAgentBench يُقَدِّم تقييمًا فعليًا لتجارب المرضى. يعتمد هذا المعيار على نموذج أساسي مسندًا في وكيل يعمل كوسيط بين المريض والسجلات الصحية. يتم تقييم كل محادثة من خلال نموذج لغة ضخم (LLM) يقيّم الأداء استنادًا إلى ستة معايير رئيسية تتجاوز مئة معيار مختلف يعتمد على تفاعلات مع أطباء مختصين.

تشير النتائج إلى وجود فجوات سريرية في الأداء؛ حيث حقق الأداء في نقل المعلومات الإدارية نسبة نجاح تصل إلى 88% لأقوى النماذج، بينما كانت نسبة النجاح لنماذج أضعف حوالي 32%. علاوةً على ذلك، ينكشف أن النماذج الأضعف كثيرًا ما تفشل في تنفيذ إجراءات طبية صحيحة، بينما تخفق النماذج الرائدة فقط في 1-3% من الحالات.

على الرغم من أن النموذج الأقوى حقق درجة 4.25 من 5، إلا أن الفجوات لا تزال قائمة. وهذا يبرز الحاجة إلى معايير تقييم أكثر تفاعلية، خاصة مع استخدام نماذج الذكاء الاصطناعي المستقل. يقدم المعيار الجديد كتقنية قابلة التكرار وقائمة على تقييم الأطباء لضمان تحسين السلامة والفعالية في هذه الأنظمة.

في ضوء هذه النتائج، يبقى السؤال: كيف يمكن تطوير أرقى أساليب الرعاية الصحية من خلال تقنيات الذكاء الاصطناعي؟