يعتبر الذكاء الاصطناعي (AI) أحد أبرز التقنيات في مجال الصحة، حيث يسهم بشكل متزايد في تحليل البيانات الصحية واتخاذ القرارات السريرية. ومع ذلك، كيف يمكننا تقييم تقدم هذه التكنولوجيا بفاعلية؟ تُظهِر دراسة جديدة أنه لتحديد مدى كفاءة الخوارزميات المستخدمة في سجلات الصحة الإلكترونية (EHRs)، يجب أن نفكر بشكل أعمق في معايير التقييم التي نعتمدها.

تواجه هذه العملية تحديات كبيرة، خاصة في ما يتعلق بإمكانية إعادة إنتاج التجارب وصعوبة تحديد المهام السريرية الهامة. هذه الدراسة، التي أُجريت على 12 خوارزمية تاريخية وحديثة، تُعَدّ محاولة للتحقق من هذه القيود من خلال تنفيذها ضمن إطار تقييم مشترك.

تم استخدام مجموعتين من البيانات السريرية، هما MIMIC-IV و NWICU، للمقارنة بين مجموعتين من المهام: المهام التي كتبها خبراء في المجتمع الطبي والمهام التي تم إنشاؤها بشكل عشوائي من رموز أحداث محددة.

وجد الباحثون أن المقارنات التراكمية للخوارزميات تنتقل بشكل قوي عبر إعدادات التقييم المختلفة، مما يبرز أهمية التخطيط الجيد لتقديم تحليلات دقيقة. بينما أظهرت المهام السريرية مع تفاعل أفضل مع طرق التقييم، فإن الخوارزميات الحديثة لم تكن دائمًا الأكثر تفوقًا. حيث تبقى الأشجار المعززة (gradient-boosted trees) منافسة قوية عند استخدامها مع تمثيل واسع ودقيق لسجلات الصحة الإلكترونية.

تشير هذه النتائج إلى أن التقدم الفعلي في الذكاء الاصطناعي الصحي قد يتطلب جهودًا أقل في هندسة المهام مما هو متوقع، مما يبرز أيضًا أهمية فهم التباين الهيكلي الموجود عبر المهام والأساليب.
هل تعتقد أن هذا البحث سيؤثر على الطريقة التي نقيم بها التكنولوجيا الصحية؟ شاركونا آراءكم في التعليقات.