في خطوة جديدة ومثيرة في عالم الذكاء الاصطناعي، تم الكشف عن نموذج MedVL-SAM2، الذي يمثل تطوراً بارزاً في نماذج الرؤية باللغة الطبية (VLMs). حيث حقق النموذج تقدماً ملحوظاً في الأداء ضمن المهام المتعلقة بصورة النص، مثل توليد التقارير والنمذجة المرئية للإجابة على الأسئلة. ومع ذلك، فإن أحد التحديات الرئيسية التي كانت تواجه نماذج VLM ثلاثية الأبعاد هو تحقيق التوافق الدقيق في القاعدة البصرية والاستدلال المكاني الحجمي داخل إطار عمل موحد.
تولت الفرق البحثية تقديم MedVL-SAM2 ليكون نموذجاً موحداً لدعم مهام متعددة تعزز من التكنولوجيا الطبية، بحيث يجمع بين توليد التقارير، والإجابة على الأسئلة (VQA)، وتقنيات التقسيم المتعددة منها التقسيم الدلالي، والتقسيم الديناميكي، والتقسيم التفاعلي. تم تصميم نموذج MedVL-SAM2 بتركيبة متماسكة تتناسب مع التحديات الخاصة بالتصوير الطبي ثلاثي الأبعاد، مما يجعله يحتوي على وحدة تقسيم حجمية قائمة على SAM2 لدعم استدلال مكاني دقيق عبر مستويات متعددة.
خضع النموذج لتدريب متدرج، حيث تم تدريبه في البداية على مجموعة بيانات ضخمة من صور الأشعة المقطعية ثلاثية الأبعاد والنصوص المرتبطة بها، وذلك لتحقيق توافق بين ميزات الصورة البصرية وخصائص اللغة الإشعاعية. بعد ذلك، خضع لتدريب مشترك يتضمن الأهداف المتعلقة بفهم اللغة والتقسيم، مما مكّن النموذج من تحسين أداءه عبر مجموعة بيانات شاملة للتقسيم بالأشعة الحاسوبية. يُتيح هذا التدريب المرن التفاعل من خلال أوامر اللغة، أو النقاط، أو صناديق التوجيه، موحّداً بذلك الاستدلال البصري العالي مع التحديد المكاني الدقيق.
بفضل هذه التركيبة المتكاملة، يقدم MedVL-SAM2 أداءً رائداً في مجالات توليد التقارير، والإجابة على الأسئلة، ومهام تقسيم ثلاثية الأبعاد المتعددة. أظهرت التحليلات الواسعة أن النموذج يمكنه توفير قاعدة بصرية ثلاثية الأبعاد موثوقة، وتقسيم تفاعلي يمكن التحكم فيه، واستدلال متقاطع قوي، مما يُظهر أن الاستدلال الدلالي العالي والتحديد الدقيق ثلاثي الأبعاد يمكن تحقيقهما معاً ضمن نموذج VLM موحد.
ما هي انطباعاتكم عن هذا النموذج الرائد؟ هل تعتقدون أنه سيحدث تحولاً في مجال الرعاية الصحية؟ شاركونا آرائكم!
مدفئة طبية ثلاثية الأبعاد: تقديم نموذج MedVL-SAM2 الثوري لتحسين الرؤية والتفكير المتعدد الوسائط!
تم الكشف عن نموذج MedVL-SAM2، وهو الابتكار الثوري في مجال الرؤية الطبية ثلاثية الأبعاد، الذي يجمع بين قدرات توليد التقارير والإجابة على الأسئلة والتقسيم الدقيق. يسعى هذا النموذج المبتكر لتوحيد أفضل ما في التعلم الآلي لتوفير فهم عميق للصورة الطبية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
