في عالم الرعاية الصحية المتطور، يُظهِر الذكاء الاصطناعي تحولاً كبيرًا من مجرد الإجابة على الأسئلة إلى أنظمة وكيلية تتفاعل مع المرضى، وتستند إلى سجلاتهم الصحية، وتعمل نيابة عنهم. ومع تطور هذه الأنظمة، أصبح من الضروري تقييم فعاليتها لضمان الأمان الدقيق. ولهذا الغرض، تم تقديم معيار جديد يحمل اسم PatientAgentBench، والذي يهدف إلى قياس أداء وكلاء الذكاء الاصطناعي في التعامل مع المرضى.
تركز معظم المعايير الحالية على المعرفة الطبية عبر مهام تفاعلية، لكن PatientAgentBench يُقَدِّم تقييمًا فعليًا لتجارب المرضى. يعتمد هذا المعيار على نموذج أساسي مسندًا في وكيل يعمل كوسيط بين المريض والسجلات الصحية. يتم تقييم كل محادثة من خلال نموذج لغة ضخم (LLM) يقيّم الأداء استنادًا إلى ستة معايير رئيسية تتجاوز مئة معيار مختلف يعتمد على تفاعلات مع أطباء مختصين.
تشير النتائج إلى وجود فجوات سريرية في الأداء؛ حيث حقق الأداء في نقل المعلومات الإدارية نسبة نجاح تصل إلى 88% لأقوى النماذج، بينما كانت نسبة النجاح لنماذج أضعف حوالي 32%. علاوةً على ذلك، ينكشف أن النماذج الأضعف كثيرًا ما تفشل في تنفيذ إجراءات طبية صحيحة، بينما تخفق النماذج الرائدة فقط في 1-3% من الحالات.
على الرغم من أن النموذج الأقوى حقق درجة 4.25 من 5، إلا أن الفجوات لا تزال قائمة. وهذا يبرز الحاجة إلى معايير تقييم أكثر تفاعلية، خاصة مع استخدام نماذج الذكاء الاصطناعي المستقل. يقدم المعيار الجديد كتقنية قابلة التكرار وقائمة على تقييم الأطباء لضمان تحسين السلامة والفعالية في هذه الأنظمة.
في ضوء هذه النتائج، يبقى السؤال: كيف يمكن تطوير أرقى أساليب الرعاية الصحية من خلال تقنيات الذكاء الاصطناعي؟
إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!
يعتمد PatientAgentBench على تقييم فعالية وكلاء الذكاء الاصطناعي الذين يتعاملون مباشرة مع المرضى، مما يعزز الأمان التشخيصي. تم تقييم 10 نماذج اعتماداً على تفاعلاتها مع مرضى محاكيين، مع وصول دقة التقييم إلى 93%.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
