في عصر الذكاء الاصطناعي، أصبح بإمكان نماذج اللغات الضخمة (Large Language Models) الإجابة عن الأسئلة الطبية بمعدل دقة يفوق معظم البشر. ولكن، ما يُخفيه هذا التفوق التكنولوجي هو الخطر الكامن في السياقات المضللة التي يمكن أن تؤثر بشكل خطير على أحكام هذه النماذج.

دراسة جديدة تناولت هذا الموضوع اشتركت في تحقيق عدة أمور حيوية مرتبطة بالسياقات المضللة: حالة النموذج عند تعرضه لمعلومات مضللة، وآلية الفهم، وشفافية القرارات المتخذة. قام الباحثون بإجراء اختبارات على مجموعة بيانات طبية تُعرف باسم MedMisBench، تتضمن 8627 سؤالًا تم تقييمها من قبل أطباء محترفين.

في هذه الدراسة، تم استخدام نوعين من السياقات المضللة: أدلة ملفقة وعبارات صارخة. وعلى الرغم من امتلاك ثلاثة نماذج عقلية للاختبار، أظهرت النتائج أن جميعها كانت أكثر تأثرًا بالعبارات الصارخة، حيث تبنت الأجوبة المُصَرح بها بنسبة 10 إلى 27 نقطة أكثر من الأدلة الملفقة.

تشير النتائج إلى أن نحو 81% إلى 98% من السياقات المضللة يتم كشفها في المسارات العقلية، لكن تُظهر الاستجابات الفعلية كشفًا أقل بكثير، تراوح بين 7% و90%.

كما أظهرت دراسة المسارات العقلية أن الأدلة تدخل مبكرًا وتتزايد بينما تؤدي العبارات الصارخة إلى توجيه الاستنتاج قرب نهاية عملية التفكير.

استخدام نماذج مراقبة اللغة الكبيرة (LLM) يمكن أن يلتقط 78% من القرارات المضللة عند فحص المسار الواعي، مع نسبة زيف تصل إلى 5%. وهذا على عكس 32% كأقصى حد من أي استجابة.

ما يستخلص من هذه الدراسة هو أن السياقات المضللة التي تتعرض لها النماذج هي الأكثر تأثراً، وفي نفس الوقت الأقل كشفًا، مما يبرز أهمية فتح مسارات التفكير لتمكين دقة أكبر في القرارات الطبية.