في عالم الرعاية الصحية الذي يتسارع فيه التطور التقني، تمثل AcuityBench خطوة نوعية نحو تحسين كيفية تقييم احتياجات الرعاية السريعة عبر نماذج الذكاء الاصطناعي. يهدف AcuityBench إلى ملء فجوة كبيرة في كيفية تقدير درجة العجلة (urgency) بناءً على تقديمات المستخدمين الطبية. بينما كانت المعايير السابقة تركز بشكل أساسي على الإجابة عن أسئلة طبية أو تفاعلات صحة عامة، كانت تفتقر إلى تقييم شامل لتحديد مستوى العجلة عبر بيئات متنوعة.

تجمع AcuityBench بين خمس مجموعات بيانات عامة تشمل المحادثات بين المستخدمين، مشاركات المنتديات، القصص السريرية، ورسائل بوابة المرضى، لتقديم إطار عمل مشترك من أربعة مستويات يبدأ من المراقبة المنزلية وصولاً إلى الرعاية الطارئة الفورية. يحتوي هذا المرجع على 914 حالة تتضمن 697 حالة مع اتفاق شامل للتقييم الدقيق و217 حالة غامضة تم تأكيدها من قبل الأطباء لتقييم الوعي بعدم اليقين.

يدعم AcuityBench نوعين من صيغ المهام: تصنيف صريح في إعداد أسئلة وأجوبة (QA) واستجابات حوارية مُقيمة بناءً على معيار مرتبط بنفس الإطار. أظهرت النتائج وجود تباين ملحوظ في دقة تحديد مستوى العجلة الخطيرة عبر 12 نموذجًا من نماذج الذكاء الاصطناعي، مع توضيح tradeoff حيث تقوم الاستجابات الحوارية بتقليل العدد الزائد للحالات ولكنها تزيد من الحالات الناقصة، خاصة في الحالات عالية العجلة.

في الحالات الغامضة، لم يقترب أي نموذج من توزيع الأحكام الطبية، مما يُظهر كيف أن توقعات النماذج تميل إلى التركيز أكثر من عدم يقين الأطباء. وتُعتبر هذه النتائج علامة جديدة تدعو لتطوير قدرات الأمان لتحديد الاحتياجات العلاجية، مما يُبرز أهمية AcuityBench كأداة مقارنة منهجية واختبار ضغط لتقييم أداء النماذج في إرشاد المستخدمين لتحقيق أفضل مستوى من الرعاية.