في عالم يتزايد فيه الاعتماد على الذكاء الاصطناعي (AI) في مجالات الرعاية الصحية، أظهرت دراسة مثيرة حديثة أن تفضيلات الأطباء المعتمدة على مقارنة ثنائية (Pairwise Preference) قد لا تكون المقياس الأمثل لتقييم السلامة السريرية لنماذج اللغة الكبيرة (Large Language Models).

تأتي هذه النتائج بعد تحليل شامل استند إلى بيانات من منصة MOOVE، التي يديرها أطباء، حيث تم جمع تفضيلات الأطباء إلى جانب تقييمات متعددة المعايير. تم تقييم 26,804 حكمًا ثنائيًا من 13 نموذج لغة كبير (LLM) من قبل 736 طبيبًا من أكثر من 28 دولة.

أظهرت النتائج أن تفضيلات الأطباء لا تعكس أداء السلامة الحرجة بشكل موثوق، إذ قد يُظهر النموذج الحائز على تفضيلات عالية معدلات كبيرة من الفشل السريري، مما يثير قلقًا بشأن استخدامه في اتخاذ القرارات الطبية.

النقاط الأخرى المثيرة تشمل توزيع الفشل السريري الذي لا يظهر في التقييمات العامة، مما يشير إلى وجود مناطق "لا ينصح بزيارتها" في مختلف التخصصات.

تركز الدراسة أيضًا على سلوك الأطباء في الرفض والتصعيد، بالإضافة إلى تأثير شدة الخصائص السطحية مقارنة بالخصائص الحرجة للسلامة.

في ضوء هذه النتائج، يقترح الباحثون ممارسات تقييم تفصل بين التفضيل والسلامة، مع ضرورة الإبلاغ عن معدلات الفشل الحرجة للسلامة. إن الدمج بين تفضيلات الأطباء والتقييمات المترتبة يمكن أن يؤدي إلى ترتيب أكثر أمانًا عند تقييم نماذج AI لقرارات طبية.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.