في عالم الرعاية الصحية، حيث تتطلب الطوارئ قرارات سريعة ودقيقة، تبرز مهمة تصنيف حالات الطوارئ (Triage) كمنطقة حساسة قد تتأثر بعمق بالمعلومات الديموغرافية والاجتماعية. تعتبر نماذج اللغة الكبيرة (Large Language Models) مصادر محتملة لدعم القرارات السريرية المحلية والحفاظ على الخصوصية، لكن من الضروري فهم كيفية تأثير التحيز المحتمل لهذه النماذج على نتائج القرارات.

دراسة جديدة تناولت فحص التحيز من منظور المقارنة لأكثر من عشرة نماذج لغة كبيرة مفتوحة المصدر خصصت لتشخيص حالات الطوارئ لدى الأطفال. بدايةً من نصوص سريرية واقعية وعبر نماذج مبنية على الكتيبات، تم إعداد نسخ مضادة تتغير فيها نقطة واحدة فقط من المعلومات الديموغرافية أو الاجتماعية مع الحفاظ على المعلومات السريرية ثابتة.

الموديلات التي تم فحصها تشمل Qwen2.5-7B، Qwen2.5-14B-Instruct، المعروف باسم QLoRA، والنماذج المرتبطة بـ MedGemma وMedLLaMA2-7B، بالإضافة إلى GPT-OSS-20B وGPT-OSS-120B. وتم قياس التغيرات واختلاف الطرح والتحويلات التقديرية، حيث أظهرت النتائج تفاوتاً كبيراً في حساسية النماذج، مما يشير إلى أن التحسينات في حجم النموذج لم يكن لها تأثير متسق على تقليل التحيز.

بعض النماذج الأكبر حجمًا أو المتخصصة في المجال الطبي أظهرت تحولات أكبر، مما يعزز أهمية الفحص المضاد كأداة خفيفة وقابلة للاستخدام لتقييم مخاطر العدالة قبل النشر السريري.

تؤكد هذه النتائج على ضرورة تقييم النماذج بعناية لضمان العدالة في الرعاية الصحية. ماذا تعتقد في هذه الدراسة؟ هل تعتقد أن نماذج الذكاء الاصطناعي يمكن أن تعزز من فعالية القرارات الصحية؟ شارك برأيك في التعليقات!