في عصر الذكاء الاصطناعي، تتزايد استخدامات نماذج اللغات الضخمة (Large Language Models) في السياقات السريرية. ولكن، هل يمكن الاعتماد عليها بشكل كامل؟
خلال دراسة حديثة، تم تقييم موثوقية هذه النماذج عند استخدامها في التقييم السريري، بمقارنة توصيات نماذج اللغات الضخمة مع آراء الأطباء الممارسين في ظل تغييرات نصية تحاكي الواقع السريري.
تم تقديم مجموعة بيانات شاملة تضم أكثر من 6,000 سيناريو سريري و7,000 ملاحظة من الأطباء و225,000 استجابة من النماذج.
أظهرت النتائج الأولى أن نماذج اللغات الضخمة تميل إلى التوصية برعاية طبية غير ضرورية أكثر من الأطباء، وهذه النزعة تتزايد عندما تتعرض المد入力ات لتغييرات غير متعلقة بالجانب السريري. كما أن نماذج اللغات الضخمة أظهرت حساسية أكبر تجاه تغييرات الجنس ونبرة الكلمات مقارنة بتوصيات البشر.
هذه النتائج تبرز ضرورة إجراء تقييمات تدعمها سلوكيات الأطباء الخبراء، مما يدل على أن الثقة في نماذج الذكاء الاصطناعي في سياقات طبية تتطلب مراجعة دقيقة وشاملة.
تحديات موثوقية نماذج اللغات الضخمة في التقييم السريري: كيف تتفوق آراء الأطباء؟
تؤكد دراسة حديثة أن نماذج اللغات الضخمة تفتقر إلى الثقة في سياقات طبية معينة، حيث تميل إلى التوصية برعاية غير ضرورية مقارنةً بأطباء الممارسين. تعزز هذه النتائج الحاجة لإجراء تقييمات تعتمد على سلوكيات الأطباء الخبراء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
