في عالم الرعاية الصحية المتطور بسرعة، تبرز نماذج اللغة الكبيرة (Large Language Models - LLMs) كحلفاء جدد للمهنيين الطبيين، حيث تُدمج في أنظمة السجلات الصحية الإلكترونية (Electronic Health Records - EHR) لتحسين كيفية استرجاع المعلومات الهامة من سجلات المرضى.
لكن كيف نضمن سلامة وفاعلية هذه الأدوات الحديثة؟.
في هذا السياق، طُور إطار عمل مبتكر يُتيح توليد مجموعة من أسئلة-إجابات تلقائيًا من الملاحظات الصحية الطويلة، مما يُنتج قاعدة بيانات تقييمية جديدة تدعى Benchmark for Retrieving Information in EHRs (BRIE).
تم التحقق من صحة مولد المعايير بواسطة تسعة عشر مُمارسًا طبيًا، مما يؤكد موثوقيته وفاعليته.
مع وجود تسعة نماذج من LLMs وخمس استراتيجيات للتفسير، وجدت الدراسات أن الأنظمة المتطورة غالبًا ما تغفل المعلومات السريرية المهمة، خصوصًا بالنسبة للأسئلة التي تتطلب دمج المعلومات من مستندات متعددة.
ما يميز قاعدة BRIE هو قدرتها على دعم التقييمات متعددة الأجوبة، والتي تعكس تنوع تفكير الأطباء، مما يُعزز من دقة الأداء. بالإضافة إلى ذلك، فإن تحديث المحتوى باستمرار يُعتبر عامل أمان ضد التسرب المعلوماتي، مما يسمح بتقييم دقيق لنماذج LLMs في بيئات الرعاية الصحية المتغيرة.
بهذا، تُظهر النتائج أن تطوير معايير قابلة للتوسع يمنح تقييمات دقيقة وحديثة للنماذج السريرية بشكل عام.