في عالم الذكاء الاصطناعي، تَعتبر نماذج الرؤية واللغة الطبية (Med-VLMs) من أبرز الابتكارات التي تسهم في عملية التشخيص. لكن هل تساءلتم يومًا لماذا لا تتحقق هذه النماذج دائمًا من الأدلة البصرية بشكل موثوق؟ نتيجة لتعتمدها على الانماط اللغوية أو القوالب الطبية، قد تُظهر بعض من هذه النماذج أجوبة دقيقة ظاهريًا، لكنها تفتقر إلى الدقة في تشخيص الحالات الحرجة.

هنا يأتي دور تقنية "On-Policy Distillation" (OPD)، التي تقدم إشرافًا على مستوى الرموز للطلاب وتسمح بنقل القدرات دون الحاجة إلى إعادة توزيع بيانات المرضى الحساسة. ومع ذلك، يواجه النموذج التقليدي لـ OPD مشكلة تتمثل في تركيزه على جميع الرموز بشكل متساوٍ، مما يجعل الرموز الحيوية الخاصة بالأدلة تتأثر بالمعلومات السردية السخية.

لذا، تم تقديم تقنية "Med-OPD"، وهي الأولى من نوعها التي تقوم بدمج عمليات التقطير مع إشراف قائم على الأدلة الطبية. تعتمد Med-OPD على مفهوم "ميزة الأدلة الطبية" (Medical Evidence Advantage) الذي يركز التقييم على الأدلة المرتبطة بالتشخيص المستهدف. من خلال مقارنة احتمالات المُدرس تحت الظروف الأصلية والتعديلات المستندة إلى الأدلة، تستطيع Med-OPD إعادة توزيع إشارة التقطير على مستوى الرموز والمخرجات، مما يزيد من أهمية الرموز الحيوية في عمليات التشخيص.

تظهر التجارب على مجموعة بيانات "OmniMedVQA" أن Med-OPD تتفوق بشكل متسق على "Super Fine-Tuning" (SFT) والنموذج التقليدي لـ OPD عبر الأشعة المقطعية (CT)، والرنين المغناطيسي (MRI)، وتشخيص الأمراض، وتصنيف الآفات.

هذه النتائج تُظهر أن التقطير المعتمد على الأدلة يمكن أن يعزز بشكل فعال اعتماد نماذج VLMs الطبية على الأدلة البصرية الرئيسية، مما يحسن من دقة التفكير الطبي المتعدد الوسائط بشكل موثوق.

إذا كنتم مهتمين بالتعرف أكثر على هذه التقنية، يمكنكم الوصول إلى الكود المصدري والبيانات عبر موقع GitHub: رابط الكود.