في عالم الطب الحديث، يكتسب الذكاء الاصطناعي أهمية متزايدة، خاصة من خلال استخدام نماذج لغوية ضخمة (Large Language Models) في عمليات التفكير السريري. ولكن، هل تستطيع هذه النماذج تحديث القرارات السريرية بفاعلية كلما تغيرت الأدلة التي يتم الاعتماد عليها؟
دراسة حديثة نُشرت في arXiv تحت عنوان "تحديث الحكم عبر الزمن" تتناول هذا السؤال الحاسم. حيث قامت بتقييم كيفية تحديث هذه النماذج لاعتقاداتها مع مرور الوقت باستخدام بيانات متطابقة من سجلات المرضى في العناية المركزة.
أظهرت نتائج الدراسة أن النماذج، عند اعتمادها على حكم سابق، كانت تميل إلى زيادة أخطاء التنبؤ بدلاً من تقليصها عندما تتغير التقديرات. هذه الظاهرة تم توثيقها مرة أخرى عند تقييم نقطة نهاية ثانية. كما كشفت التدخلات المُ控制ّة عن وجود نمطين من الخلل في الأداء. الأول، عندما يتم تثبيت الحكم السابق، استجابت النماذج بشكل أقوى للأدلة التنفسية المتدهورة مقارنة بالأدلة المحسنة، وهو ما أظهر عدم التوازن في التصنيف.
أما الثاني، فهو عندما تم تثبيت الأدلة الحالية، فإن زيادة المخاطر المسبقة من 10% إلى 90% أدت إلى تغيير التقديرات بنسبة 26.2 نقطة مئوية. وهذا يعكس التأثير السببي للاعتقادات السابقة للنموذج، مما يجعل الأمر أكثر تعقيدًا. وللأسف، لم يُسترد تحديث موثوق من خلال الاستجابة للتحفيز.
تحتوي الدراسة على مفهوم "تحديث موثوق عبر الزمن (Evidence-Validated Longitudinal Update - EVLU)"، الذي حدد تحديثات أقل ولكن أكثر موثوقية، مما يكشف عن توازن بين الموثوقية والتغطية. تبرز هذه النتائج تحديث الاعتقادات عبر الزمن كبعد متميز من موثوقية النماذج اللغوية الضخمة، مما يفتح المجال لاستمرار البحث في هذا المجال.
نموذج لغوي ضخم: تحديات في تحديث الحكم السريري مع تطور الأدلة الطبية!
لا تزال النماذج اللغوية الضخمة (LLMs) تثير تساؤلات حول قدرتها على تحديث الأحكام السريرية بشكل موثوق مع تغير الأدلة الطبية. دراسة جديدة تُظهر حجم التحديات التي تواجه هذه النماذج في السياقات السريرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
