تشهد نماذج الرؤية واللغة الطبية (Vision-Language Models) تقدماً ملحوظاً في توليد سرديات سريرية مقنعة، إلا أن هذه النماذج غالباً ما تُعاني من صعوبة في تأصيل بياناتها بصرياً. يعود ذلك، وفقاً لدراسات حديثة، إلى نقص عائدات تمتاز بالجودة العالية في أقواس الإحالة السريرية الكبيرة.

لذا، تم تقديم "مدغراوند" (MedGround) كنظام آلي مبتكر يقوم بتحويل موارد التقسيم إلى بيانات إحالة سريرية عالية الجودة. يستفيد مدغراوند من أقنعة الخبراء كنقاط مثبتة في الفضاء، مما يُمكّن من اشتقاق أهداف الموقع بدقة، واستخراج القواطع الشكلية والمكانية، وإرشاد نماذج الرؤية واللغة لتوليد استفسارات طبيعية وسريرية تعكس الشكل والموقع بدقة.

لضمان صرامة البيانات، تم اعتماد نظام تحقق متعدد المراحل يتضمن تدقيقات دقيقة، وقواعد هندسية وطبية مسبقة، وتقييم بصري معتمد على الصور لتصفية العينات الغامضة أو غير المدعومة بصرياً.

إضافة إلى ذلك، تم تقديم مجموعة بيانات جديدة تُدعى "مدغراوند-35K" (MedGround-35K)، وهي مجموعة طبية متعددة الوسائط. وتجري تجارب موسعة تظهر أن النماذج المدربة باستخدام هذه المجموعة تُحقق أداءً محسنًا في الإحالة البصرية، وتعزز التفكك الدلالي للأشياء المتعددة، وتظهر قدرة قوية على التعميم في إعدادات الإحالة غير المرئية.

هذا العمل يُبرز مدغراوند كنهج قابل للتوسع وقائم على البيانات لربط اللغة الطبية بأدلة بصرية يمكن التحقق منها.