في السنوات الأخيرة، أصبح تصنيف أورام الدماغ باستخدام صور الأشعة بالرنين المغناطيسي (MRI) من التطبيقات الرائدة لتقنيات التعلم العميق في التصوير الطبي. ومع أن التقارير تشير إلى دقة تجاوزت 98% في المعايير العامة، إلا أن دقة الأداء لا تعكس حقيقة هامة تتعلق بنزاهة البيانات.

أطلقت دراسة جديدة، تم نشرها على منصة arXiv، إطارًا من ثلاث طبقات لتقييم تسرب البيانات في مجموعات البيانات العامة، توضح كيف يمكن لتكرار البيانات، تسرب المرضى، وتسرب مصادر البيانات أن يؤثر سلبًا على النتائج.

ومع مراجعة ثلاثة من أكثر مجموعات البيانات استخدامًا، كشفت الدراسة أن نسبة كبيرة من الصور المستخدمة في الاختبار تتداخل مع مجموعة بيانات التدريب. على سبيل المثال، وجود 28.8% من الصور في مجموعة الاختبار تتواجد أيضًا في مجموعة التدريب لنفس المجموعة. كما أن 22.3% من الصور في مجموعة بيانات أخرى تتشابه بشكل حرفي.

النتيجة المثيرة للدهشة هي أن إزالة الصور المتسربة لم تؤثر بشكل كبير على دقة النموذج المتوازن، مما يشير إلى أن الأداء المستقر لا يعني بالضرورة نزاهة البيانات.

تشير النتائج إلى ضرورة إعادة التفكير في كيفية تقييم جودة المعايير في البحث الطبي، حيث أنه لا يمكن الاعتماد على أرقام الدقة فقط دون التأكد من أن النموذج قد تعلّم حقًا التعرف على الأورام بدلاً من استغلال إشارات عشوائية في البيانات. كما أن الباحثين قاموا بإصدار قوائم بالملفات المتسربة والمعرفات المستعادة للمرضى، مما يتيح للباحثين مزيد من فهم التحديات الموجودة في مجال تصنيف أورام الدماغ.