في عالم الذكاء الاصطناعي، تُظهر نماذج الرؤية اللغوية الطبية (Medical Vision-Language Models) قدرة كبيرة في الإجابة على الأسئلة المرئية في المجال الطبي. ولكن، كانت هذه النماذج تعاني من تركيزها المفرط على النصوص، إذ عُدَّت الصور بمثابة سياق ثابت يُستخدم مرة واحدة فقط. وهذا يطرح تحديات حقيقية في السيناريوهات السريرية، حيث تتطلب الإجابات الدقيقة أدلة بصرية محلية قد تكون حساسة ودقيقة.
إليك الحل الجديد: MedLVR، وهو إطار جديد للعرض المرئي الكامن (Latent Visual Reasoning)، يعمل على إدخال حالة أدلة بصرية واضحة داخل عملية فك الشفرات التلقائية (Autoregressive Decoding). في هذا النظام، لا يمكن الاعتماد فقط على التفكير القائم على النصوص، بل يتم دمج قسم قصير من التفكير الكامن ضمن العمليّة، مما يتيح عملية الحفاظ والتكرار التدريجي للأدلة البصرية المرتبطة بالاستفسار قبل توليد الإجابة.
تستند منهجية MedLVR على استراتيجية تدريب ثنائية المرحلة: يشمل التدريب الفائق على مناطق الاهتمام (ROI) وأيضاً تحسين سياسة العرض البصري الكامن (Visual-Latent Policy Optimization - VLPO) التي تعزز جودة التفكير الكامن والإجابة بناءً على المكافآت المستندة إلى النتائج.
وأظهرت التجارب على اختبارات OmniMedVQA وخمس اختبارات خارجية أخرى أداءً متفوقاً، حيث ارتفعت النتيجة المتوسطة من 48.3% إلى 53.4% مقارنة بنموذج Qwen2.5-VL-7B، مما يعكس كفاءة هذا الحل الجديد في تعزيز الاعتمادية في الإجابات الطبية.
ختاماً، يعد MedLVR خطوة هامة نحو تحسين موثوقية نموذج السؤال والجواب في المجال الطبي، ويمثل بادرة أمل لزيادة دقة وكفاءة الرعاية الصحية.
ثورة جديدة في الذكاء الاصطناعي الطبي: MedLVR لتحسين إجابات الأسئلة المرئية!
تقدم MedLVR إطاراً جديداً للعرض المرئي الكامن الذي يعزز من دقة الإجابات على الأسئلة الطبية. من خلال دمج أدلة بصرية حقيقية، يرتفع معدل النجاح في هذه النماذج بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
