في سياق الطب المبني على الأدلة، يتطلب اتخاذ القرارات الطبية الصائبة اتساقًا منطقيًا صارمًا. لكن، هل يمكن لنماذج اللغة الكبيرة (LLMs) أن تتبع هذا المنطق بكفاءة؟ في هذا الإطار، تم تقديم معيار LogiMed-RoB، الذي يستند إلى منطق الخبراء في تقييم مخاطر الانحياز (RoB) من كوكراين، ويناقش أهمية هذا المعيار في قياس فعالية نماذج الذكاء الاصطناعي في السياقات الطبية.

يتضمن المعيار LogiMed-RoB دراسة 860 تجربة عشوائية محكومة وإجراء 14,820 استفسار. يقيّم أداء النماذج وفقًا لإطار العمل الخاص بالاتساق المنطقي الهرمي (HLC) عبر أربعة أبعاد: الاتساق الذري، الاتساق العيادي، اتساق التجميع، والأمانة الأدلة.

تكشف التجارب التي أُجريت على 10 من أحدث نماذج اللغة الكبيرة عن مشكلة كارثية تُعرف بتأثير تراكم الأخطاء، حيث تفشل النماذج في الحفاظ على اتساقها المنطقي رغم تحقيق أعلى نموذج لنسبة اتساق ذري تصل إلى 98.88%، إلا أن الاتساق الشامل ينخفض إلى 45.13%، مع انخفاض حاد لبعض المعماريات إلى ما يقرب من 0%.

علاوةً على ذلك، تم اكتشاف فجوة منهجية بين الأدلة والاستدلال، حيث تفشل النماذج في استنتاج النتائج الصحيحة في 18.63-40.05% من الحالات حتى عندما تسترجع أدلة عالية الجودة، بينما تصل معدلات التخمين الأعمى إلى 48.28%. تُظهر LogiMed-RoB أن الدقة العالية للنتائج قد تخفي عيوبًا حرجة في المنطق، مما يُبرز أهمية التحقق المنطقي الواضح لضمان السرعة السريرية.

إذًا، هل يمكن لنماذج اللغة الكبيرة حقًا تقليد منطق الخبراء الطبيين، أم أننا بحاجة إلى مزيد من البحث والتحليل لضمان الدقة والأمان في الرعاية الصحية؟