في ظل الاستخدام المتزايد لنماذج الرؤية اللغوية (Vision Language Models) في تشخيص الأمراض، أصبح من الضروري فهم كيفية معالجتها للإشارات المرئية والنصية المتنافسة تأميناً للسلامة. يبين البحث الجديد أن الأنماط الميكانيكية الموجودة حالياً تقتصر على النصوص الأحادية ولا تفسر سبب تخطي جملة مضللة لتشخيص صحيح قائم على الصورة، أو لماذا يلتزم النموذج بإجابة واثقة رغم نقص الأدلة المرئية.

تحدد الدراسة مخاطر السلامة المرتبطة بالرؤية اللغوية، مثل "فشل التحكيم" (Arbitration Failure) حيث تتجاوز النصوص السياقات المرئية، و"فشل المكابح" (Brake Failure)، الذي يحدث عندما يلتزم النموذج بإجابة ما مع عدم وجود أدلة كافية. تم تحليل هذه المخاطر من خلال مجموعة من رؤوس الانتباه المكانية، حيث توضح التجارب كيف أن "رؤوس التحكيم" تعمل على تجاوز الأدلة في طبقات معينة، بينما تتركز "رؤوس المكابح" في الطبقات المتوسطة المتأخرة المنظمة لسلوك الاستغناء عن الأدلة.

لتسليط الضوء على هذه الملاحظات، تم تقديم تقنية CRAFT، التي تحدد كل نمط فشل إلى مجموعة رأسية سببية عبر معايير مزدوجة، وتحقق من الضرورة والكفاية باستخدام البروبت الزمنية وتحليل زوايا معززة. تُظهر التجارب عبر معايير متعددة للتشخيص الطبي فعالية هذه التدخلات، حيث تؤكد النتائج أن التحسين المستهدف يمكن أن يعيد الاستجابة السليمة مع تقليل الأضرار غير المرغوب فيها.

تُعد هذه النتائج مثيرة، حيث تسلط الضوء على الفصل الميكانيكي بين أنماط الفشل وتمكن الباحثين من تحسين نماذج التشخيص دون الحاجة لإعادة تدريبها. فهل يمكن أن تغيّر CRAFT المعايير في كيفية استخدامنا للتكنولوجيا في القطاع الصحي؟