في عالم الطب، يعتمد الأطباء في تشخيصاتهم على تسلسل محدد من الاختبارات، حيث يبدأون بالتحليلات الأقل تكلفة ثم يتجهون نحو الاختبارات الأكثر كلفة فقط عند الحاجة. في هذا السياق، يمثل نموذج ActiveMedAgent ثورة حقيقية في تشخيصات الطب المتعدد الوسائط، حيث يجسد منطقًا تسلسليًا واعيًا للتكاليف.

يعتمد ActiveMedAgent على نموذج رؤى اللغات (vision-language model) الذي يتم الوصول إليه عبر API. يقوم هذا النموذج بتعقب توزعات الاحتمالات الخاصة بالتشخيصات المحتملة، ويقوم بتقييم كل اختبار بناءً على فائدة التشخيص المترتبة عليه مقارنة بتكاليفه.

عبر استخدام موجه متعدد الطبقات (MLP)، يتم تدريب النموذج على هذه المسارات المسجلة، ليكتسب القدرة على تحديد متى يجب طلب أدلة إضافية ومتى يجب الالتزام التشخيصي.

أظهرت النتائج عبر ثلاثة معايير معتمدة أن التعلم المعتمد على المسارات أثبت تفوقه بشكل مستمر مقارنةً بالأساليب التقليدية، مما يثبت كفاءة ActiveMedAgent في تقليل التجارب الغير مفيدة. من المثير للانتباه أيضًا اكتشاف ظاهرة تعرف بزيادة المعلومات، حيث تمكن النموذج في 175 حالة من تقديم تشخيص صحيح باستخدام قنوات معلومات أقل، في حين أن النماذج التقليدية لم تنجح، مما يشير إلى أن معرفة ما يجب تجنبه هو بنفس أهمية معرفة ما يجب اكتسابه.