شهدت الساحة الصحية ثورة حقيقية بفضل تقنيات الذكاء الاصطناعي، ولكن دراسة نُشرت في مجلة Nature Medicine كشفت أن نموذج ChatGPT Health يُخطئ في تصنيف حوالي 51.6% من الحالات الطارئة، مما يثير المخاوف بشأن سلامة استخدام هذه التقنيات في الرعاية الصحية. ومع ذلك، تبين أن بروتوكول التقييم المستخدم كان يعتمد على إطار عمل امتحاني يُجبر النموذج على تقديم إجابات محددة دون إمكانية التعامل مع الأسئلة التوضيحية، مما لا يعكس كيفية استخدام العملاء العاديين للدردشات الصحية.
في دراسة جديدة، تمت مقارنة أداء خمسة نماذج من نماذج اللغات الضخمة (LLMs) على مجموعة من 17 سيناريو باستخدام أسلوب وضع الرسائل الطبيعية للمرضى بدلاً من الإطار المقيد، وقد أظهرت النتائج تفوقًا بفارق 6.4 نقاط (p=0.015) عند استخدام الرسائل الطبيعية. في حالة معينة، حقق ثلاثة نماذج أداءً من 0-24% مع الاختيارات الجبرية، ثم ارتفع إلى 100% عند استخدام النص الحر.
وفي تجريب آخر، تم إجراء نفس الاختبارات على 60 سيناريو تم إصدارهم من قبل مؤلفي الدراسة الأساسية، وكان هناك عكس واضح في النتائج؛ حيث حصلت إعادة كتابة النص الحر على نقاط أقل قليلاً مقارنةً مع التنسيق الهيكلي المحدد.。
تكشف هذه الدراسات أن نتائج تقييم هذه النماذج لا تعتمد فقط على قدرتها، بل أيضًا على طريقة التصنيف المستخدمة. تتطلب المطالبات الداعية للسلامة أن تقدم تقارير تفصيلية عن حساسية النماذج تجاه صيغ الإدخال وطريقة التقييم، مما يتطلب وعيًا أكبر من قبل المختصين في هذا المجال.
دراسة تكشف: تقييم نماذج الذكاء الاصطناعي في الرعاية الصحية قد يكون مضللاً!
توصلت دراسة حديثة إلى أن تقييم نماذج الذكاء الاصطناعي، مثل ChatGPT Health، قد يشير إلى أرقام خاطئة حول قدرتها على التخفيف من حالات الطوارئ. تعود المشكلة إلى طريقة التقييم المستخدمة، مما يثير تساؤلات حول فعالية هذه النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
