يشكل التوافق في أنظمة الرعاية الصحية أحد أبرز التحديات التي تواجهها تقنيات الذكاء الاصطناعي. فمع دخول نماذج اللغة العملاقة (Large Language Models) مثل Qwen2.5 وLlama 3.1 وGemma2 إلى الساحة، يتوجب عليها تقديم مخرجات منسقة تتماشى مع المعايير المعتمدة، مثل ICD-10 لتشفير التشخيص، وCPT لفوترة الإجراءات، وHL7 FHIR لتبادل البيانات.

في دراسة جديدة، تم تقييم هذه النماذج في 320 سيناريو سريري عبر عشر تخصصات طبية، حيث تم فحص 960 زوجًا من السيناريوهات والنماذج في ظروف التحقق والإصلاح. وكشفت النتائج عن أن عدم التوافق مع المعايير كان سمة بارزة بين جميع النماذج، حيث تراوحت معدلات التوافق الأولية بين 85.9 إلى 91.6%، مما يدل على وجود فجوات في بيانات التدريب الطبية المستخدمة بدلاً من عيوب نماذج محددة.

كما أظهر 96% من المشاكل التي اكتشفها المحققون أنها انتهاكات لمستوى التمثيل، مثل الاختصارات الطبية البديلة وبدء الرموز، مما يشير إلى أن النماذج تتبع تقاليد الكتابة السريرية ولكنها تفتقر لفهم معايير تكنولوجيا المعلومات الصحية.

ومع تطبيق إطار العمل للتحقق والإصلاح، تمكن الباحثون من تحقيق 99.0% من التوافق الشامل، حيث تراوحت النسب بين 98.4% إلى 99.4% عبر مختلف النماذج، مع احتواء معظم الأخطاء على حل سريع خلال دورة أو دورتين.

هذه النتائج تعزز فكرة استخدام إطار العمل المغلق للتحقق والإصلاح كوسيلة فعالة لضمان تكامل أنظمة الرعاية الصحية، مما يحسن الاستعداد على مستوى المخططات في نطاق تكامل الأنظمة السريرية.