في عالم الرعاية الصحية، يُعتبر التصوير بالرنين المغناطيسي متعدد المتغيرات (mpMRI) أساسًا رئيسيًا لتشخيص وعلاج الأورام الدماغية. ولكن تظل العديد من النماذج الحالية غير قادرة على تلبية احتياجات الأطباء بسبب افتقارها للتفاعل الطبيعي مع اللغة والقدرة على التفسير. لذلك، أُطلق نموذج Mr3D-VL ليحل هذه المشكلة.

يتمتع Mr3D-VL بقدرات فريدة، حيث يمتلك 4 مليارات معلمة ويستخدم تقنية التشفير ثلاثية الأبعاد المدرب مسبقًا وعمق الدوران الزمني الرباعي لتحقيق تكامل مكاني للأبعاد المختلفة.

تواجه النماذج الحالية تحديات متعددة، مثل الاختلافات الكبيرة في المعاني الفيزيائية بين الوسائط وعدم توافق البيانات في الوقت الزمني. يوفر Mr3D-VL حلاً متكاملاً من خلال استخدام طبقة الإسقاط عبر الوسائط، حيث يتم تطبيق استراتيجية زراعة ميزات متعددة الدقة لتحسين إدراك الميزات عبر مختلف الدقة.

أظهرت التجارب أن نموذج Mr3D-VL يتفوق بشكل كبير على النماذج التقليدية في مهام توليد النصوص، حيث سجل BERTScore قدره 0.856، مما يعكس قدرته العالية على تنفيذ التقارير بدقة وفاعلية. علاوة على ذلك، فقد حقق دقة مميزة في الأسئلة والأجوبة بلغت 0.713، ودقة اختيار متعددة بلغت 0.912.

إن هذا الابتكار ليس فقط تطورًا تقنيًا، بل يمثل أيضًا خطوة مهمة نحو تقديم رعاية صحية عالية الجودة باستخدام الذكاء الاصطناعي. فهل لديك رأي في هذا النموذج الثوري؟ شاركنا أفكارك في التعليقات!