يظهر الذكاء الاصطناعي في مجال الطب تطورًا ملحوظًا بفضل الأساليب الحديثة في نماذج اللغة متعددة الوسائط (MLLMs). رغم أن معظم هذه النماذج كانت تركز على تحليل صورة واحدة فقط، إلا أن التحديات السريرية تتطلب تفاعلًا من خلال دمج الأدلة من عدة صور، بما في ذلك أنواع مختلفة من الصور وزوايا العرض والفترات الزمنية.
لملء هذه الفجوة، تم تطوير مجموعة بيانات ضخمة تُعرف باسم PMC-MI، والتي تضم أكثر من 234,000 حالة تعليمية مأخوذة من شخصيات طبية مركبة، وكذلك 10,555 حالة متعددة الصور مصممة لتقديم دعم للتعلم التعزيزي. تم تقييم هذه البيانات من قبل مراجعين طبيين لضمان جودتها.
إضافة إلى ذلك، تم تقديم معيار جديد تحت اسم PMC-MI-Bench، يقيم الأداء عند مستوى المقالة المصدر.
بينما وُضعت خطة تدريب ثلاثية المراحل للنموذج الجديد M3LLM، والتي تشمل تعديلًا تحت إشراف على تعليمات متعددة الصور، واختيار ذكي للأدلة البصرية، بالإضافة إلى تكامل إشرافي مع مجموعة أكبر من التعليمات. النتائج المبهرة للنموذج M3LLM على معايير PMC-MI-Bench أثبتت أنه قد أحرز أعلى درجات الأداء مقارنة مع نماذج اللغة متعددة الوسائط الأخرى.
إذ حصل M3LLM على درجات 81.6 و84.6 و85.2 في مهام تحليل الصور الفردية والمتعددة، متفوقًا على أعلى المعايير السابقة (75.6 و79.1 و77.6). كما سجل النموذج أيضًا أرقامًا قياسية جديدة على اختبارات مثل OmniMedVQA وMMMU-Med.
تؤكد هذه النتائج على أهمية استخدام الإشراف من الأدبيات الطبية المتعددة الصور والتكيف المستهدف بعد التدريب في تعزيز مهارات نماذج MLLMs الطبية.
ثورة جديدة في الذكاء الاصطناعي الطبي: نموذج M3LLM يسجل إنجازات غير مسبوقة!
تستعد نماذج اللغة متعددة الوسائط (MLLMs) لتغيير قواعد اللعبة في مجال الطب، حيث يقدم نموذج M3LLM تقنيات تجمع بين عدة صور طبية لتحقيق أداء استثنائي. اكتشفوا كيف يتم تطوير هذا النموذج وتفاصيل إنجازاته الرائعة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
