في عالم الرعاية الصحية، يُنظر إلى نماذج اللغة الكبيرة (LLMs)، مثل نموذج Qwen2.5، كأحد الأدوات الثورية. لكنها ليست بدون عيوب. قد تتوقع أن النموذج يمكنه الإجابة بدقة عن الأسئلة السريرية، ولكن هناك عامل خطر يُهمل غالبًا: الانحياز السردي المؤثر على الإجابات.

تستعرض دراسة حديثة مخاطر ما يسمى بـ "انحياز التثبيت السردي الواعي بالعوامل الاجتماعية والتجريبية" (SDoH-Aware Narrative Anchoring Bias). هذه الدراسة استخدمت مجموعة بيانات NarrativeShield SDoH MedQA، والتي تحتوي على أسئلة طبية مُصاغة بطرق سردية متنوعة، لكن الإجابات تظل ثابتة. هذا يعني أن النموذج قد يقدم إجابات مختلفة لنفس الحالة إذا كانت مكتوبة بأصوات مختلفة للمرضى.

عُرضت النتائج باستخدام ثلاثة نماذج مفتوحة المصدر من عائلة Qwen2.5، وهي: 1.5B، 3B، و7B. اختبرت التجربة النهائية 300 حالة سريرية، مما نتج عنه 8100 استجابة نموذجية تحت ثلاث ظروف تحفيزية مختلفة. النتائج أظهرت أن نموذج Qwen2.5 7B حقق أفضل دقة بلغت 56.33% وأفضل استقرار في الإجابات الصحيحة بنسبة 40.33%.

أما بالنسبة للأسئلة السردية، وقفت نسبة الخطأ عند 31.67%، مما ينبهنا لوجود قلق كبير حول الاستجابة النمطية للنماذج. من المهم أن ندرك أن الدعم السريري الموثوق يجب أن يتم تقييمه بناءً على الدقة المتوسطة والثبات عبر السرديات الطبية المكافئة.

في ضوء هذه النتائج، هل ينبغي علينا تغيير كيفية تصنيف موثوقية أنظمة الذكاء الاصطناعي في المجال الطبي؟ ما هي الخطوات التي يمكن اتخاذها لضمان اتخاذ القرارات الطبية الأكثر دقة؟ شاركونا آرائكم في التعليقات!