تتمتع ممارسات كتابة تقارير الأشعة بخصائص متنوعة قد تؤثر بشكل كبير على تقييم نماذج الذكاء الاصطناعي (AI) المستخدمة في هذا المجال. في دراسة جديدة، سلط الباحثون الضوء على هذه الاختلافات التي غالباً ما يتجاهلها التقييمات التقليدية. يُظهر تحليلهم أن مقارنة أداء نماذج توليد التقرير (RRG) تعتمد إلى حد كبير على كيفية كتابة التقارير، حيث يمكن لتغيرات بسيطة في المصطلحات والتنسيق أن تؤثر على التقييمات بشكل كبير.
تم تطوير نظام تصنيف مدعوم من قبل أطباء الأشعة، حيث يقدم طريقة (ReRef) لإعادة كتابة التقارير بطريقة تعكس الاختلافات بوضوح، مع الحفاظ على التفسير السريري. على سبيل المثال، عند مقارنة أداء تسعة نماذج (RRG) على مجموعة بيانات MIMIC-CXR، أدى تغيير في كيفية تقديم المعلومات العادية إلى تغير كبير في الترتيب، حيث تراجع نموذج Libra عن المركز الأول لصالح نموذج CheXOne الذي تصدر القائمة.
تؤكد هذه النتائج على أهمية اختيار المراجع الصحيحة التي تعكس بدقة الممارسات المرجوة وتسلط الضوء على الفجوات الموجودة في المقاييس المستخدمة حاليًا لتقييم نماذج الذكاء الاصطناعي. لتحسين الأبحاث المستقبلية، تم إصدار مجموعة بيانات جديدة (MIMIC-CXR-Ext-ReRef) تحتوي على 120 زوجًا من التقارير الأصلية والبديلة المصدقة من قبل أطباء الأشعة.
كيف يؤثر اختيار المراجع على تقييم تقارير الأشعة الصدرية؟
تكشف دراسة جديدة عن تأثير اختلافات الممارسات في كتابة تقارير الأشعة على تقييم نماذج الذكاء الاصطناعي المستخدمة في هذا المجال. يتم تقديم طريقة مبتكرة لتحسين دقة التقييم من خلال إعادة كتابة التقارير مع الحفاظ على التفسير السريري.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
