في عالم الطب المعاصر، يشكل التنبؤ بالمخاطر الصحية من العناصر الحيوية التي تدعم اتخاذ القرارات الدقيقة. ومع تزايد دور نماذج اللغة الكبيرة (Large Language Models) في فهم النصوص الطبية والإجابة على الاستفسارات، أثبتت هذه النماذج أن قدرتها اللغوية لا تضمن بالضرورة دقة التوقعات المستمدة من السلاسل الزمنية السريرية المعقدة.

هنا يأتي دور ViSTA، وهو مدخل مبتكر يعمل كجسر لجعل القدرة على التنبؤ أكثر دقة. يقدم ViSTA نموذجًا متناغمًا يدمج القياسات الرقمية غير المنتظمة ضمن تمثيلات المخطط الموجودة في نماذج الرؤية واللغة المدربة مسبقًا. والمثير للاهتمام، أن ViSTA لا يغير أي من المعلمات المدربة مسبقًا، بل يتعلم كيف يصحح الرموز البصرية بشكل فعّال.

وفقًا للدراسات التي أجريت على مجموعة بيانات MIMIC-IV، يُظهر ViSTA أداءً متفوقًا، حيث يسجل أعلى تقديرات متوسط على جميع المقاييس الأربعة المرتبطة بتوقع الإصابات الحادة في الكلى ووفيات المرضى، مستخدمًا نماذج تتراوح بين 2 إلى 9 مليار معلمة. بل، مع 0.516 مليون معلمة فقط يمكن تدريبها، وصلت النموذج الذي يتكون من 2 مليار معلمة إلى معدل Area Under the ROC Curve يبلغ 0.7376 في توقع الإصابة الحادة في الكلى.

عند تدريب النموذج على أسئلة زمنية، بلغ معدل الدقة 69.27% مع 4 مليارات معلمة، محققًا انخفاضًا يزيد عن 90% في المعلمات القابلة للتدريب بالمقارنة مع تكييف منخفض الرتبة باستخدام المخططات أو النصوص الرقمية، بفارق في الدقة يصل إلى 2.82-4.88 نقطة.

باختصار، يبرز ViSTA كأداة تمثل قفزة نوعية في ربط النماذج اللغوية بالتركيز على التنبؤات الرقمية والأسئلة الزمنية، مما يفتح آفاق جديدة لفهم شامل للحالات السريرية. هل ترى أن هذه التكنولوجيا ستكون لها تأثير كبير على مستقبل الطب؟ شاركونا آراءكم في التعليقات!