في خطوة مثيرة في عالم الذكاء الاصطناعي والطب، تم الكشف عن ObGynLongBench، معيار متقدم يعالج الفجوة بين الأدلة وسجلات الصحة الإلكترونية (EHR) في اتخاذ القرار المتعلق بالصحة النسائية. إن تطبيق نماذج اللغة الكبيرة (LLMs) كأدوات مساعدة طبية شخصية لاقى اهتمامًا متزايدًا، إلا أن التحدي يبدو واضحًا. فبينما تعتمد المعايير الطبية الحالية بشكل كبير على الإجابة عن أسئلة ثابتة ذات أدلة محددة مسبقًا، تظل قدرة هذه النماذج على اتخاذ قرارات طبية موثوقة من سجلات الصحة الإلكترونية الطويلة غير واضحة.

يهدف ObGynLongBench إلى سد هذه الفجوة من خلال تقديم مقياس يعتمد على القواعد لعلاج المسائل المتعلقة بالصحة النسائية. يتكون المعيار من 1500 حالة قرار مسبق سريري مأخوذ من 976 تاريخ حمل حقيقي، مما يتيح تقييمًا شاملاً يعتمد على الأدلة فقط أو من سجلات الزيارات أو تاريخ السجل الإلكتروني.

بينما قُيمت 17 نموذجًا من نماذج اللغة الكبيرة، تم الكشف مؤخرًا عن فجوة كبيرة بين الأدلة وسجلات الصحة الإلكترونية. الأداء كان جيدًا عندما تم تقديم الأدلة مباشرة، لكن دقة النتائج انخفضت بشكل ملحوظ عندما كان من الضروري استخراج الأدلة من السجلات ذات التاريخ اليومي أو السجلات الطويلة السابقة. تكشف المزيد من التحليلات أن استخدام الأدلة يشكل عقبة رئيسية، حيث يقل الأداء مع زيادة طول سياقات السجلات الإلكترونية وتعقيد متطلبات الأدلة. كما أن الإخفاقات المبكرة غالبًا ما تتنبأ بالإخفاقات اللاحقة ضمن نفس تاريخ المريض.

أظهرت النتائج أن وكلاء البحث الفعالين يمثلون أفضل الاستراتيجيات للوصول إلى السجلات الإلكترونية، مما يسليط الضوء على أهمية استغلال الأدلة الخاصة بالمرضى كأحد التحديات المركزية لضمان مساعدات طبية شخصية موثوقة. لمزيد من التفاصيل، يمكن الوصول إلى الموارد المتاحة عبر الرابط: https://github.com/xiangjun2003/ObgynLongbench.