في ظل التطورات السريعة في الذكاء الاصطناعي، تبرز نماذج الرؤية واللغة (Vision-Language Models - VLMs) كأداة قيمة لتحليل البيانات الطبية، مثل تحليل الأشعة. ومع ذلك، لا تزال مسألة تقديم تفسيرات موثوقة ومفهومة تمثل تحدياً كبيراً عند نشر هذه التكنولوجيا في البيئات السريرية.

تستند العديد من طرق التفسير الموجودة، مثل إطار FIxLIP الشهير، إلى فرضيات معينة قد تكون غير قادرة على التعاطي مع التفاصيل الدقيقة لعملية "التعادل" (tokenization) الحديثة. حيث تؤدي عملية تفكيك المصطلحات السريرية، مثل "السدادة الملزمة" (saddle embolus)، إلى تجزيء الكلمات إلى أجزاء غير ذات معنى، مما ينتج عنه تفسيرات متقاطعة غير مترابطة. هذه الفوضى تعيق إمكانية فهم السبب وراء قرارات النموذج.

لذلك، نُقدم تقنية جديدة تُسمى ParseFIxLIP، والتي تعتمد على تضمين التحليل الشجري (Tree-Gram Parsing) في لعبة التفاعل Banzhaf المستخدمة سابقًا في FIxLIP. هذه الاستراتيجية المدروسة تستخدم أشجار تحليل الاعتماد لتعريف اللاعبين في عملية التفسير، حيث تجمع رموز النص المرتبطة في وحدات ذات معنى واضح.

تقوم استراتيجية التجميع الذكي (smart_depth) لدينا، التي تعتمد على شجرة تحليل الاعتماد من مكتبة spaCy، بتخفيف التجزئة المفاهيمية بشكل فعال, مما ينتج عنه تفاعلات متقاطعة أكثر توضيحًا ووضوحًا، من خلال توحيد المفاهيم الطبية المعقدة.

على الصعيد الكمي، بينما كانت النماذج السابقة تعاني من مشكلة الأبعاد العالية للتسميات الطويلة، فقد حافظ منهجنا على قوة إحصائية ونقاء دلالي. التحليل النوعي على نموذج BiomedCLIP، معتمدًا على صور طبية (ROCOv2) وأمثلة عامة، يؤكد أن هذه الطريقة تلتقط بدقة التأثير المتآزر للكلمات المجموعة على تنبؤات النموذج.

في الختام، يقدم عملنا رؤى عميقة وسلسة حول كيفية اتخاذ قرارات نماذج الرؤية واللغة (VLM)، مما يلبي الحاجة الملحة للحصول على تفسيرات متسقة ومترابطة في المجال الطبي.