في عالم التكنولوجيا الحيوية، يمثل تصنيف أصوات القلب (Phonocardiograms) خطوة هامة نحو تحسين خدمات الرعاية الصحية. في دراستهم الأخيرة، قدم الباحثون تقنية جديدة تُعرف باسم AudioFuse، التي تعتمد على بنية هجينة تجمع بين نموذج Vision Transformer (ViT) ونموذج CNN أحادي البعد.

أصوات القلب تحمل تفاصيل غنية في كل من المجال الطيفي (Spectral) والزمني (Temporal)، لكن التقنيات التقليدية غالبًا ما تتجاهل بعض المعلومات الحيوية. إلا أن AudioFuse تتفوق هنا، حيث تُظهر قدرة على التعلم من كلا التمثيلين بشكل متزامن. بناءً على مجموعة بيانات PhysioNet 2016، حققت التقنية الجديدة ROC-AUC مذهلة وصلت إلى 0.8608، متجاوزة النتائج السابقة لموديلات spectrogram (0.8066) وwaveform (0.8223).

لكن المثير حقًا هو أداء AudioFuse في مواجهة التغيرات في المجال، حيث حققت ROC-AUC قدرها 0.7181 على مجموعة بيانات PASCAL، بينما انخفضت فاعلية الأنظمة التقليدية بشكل كبير إلى 0.4873. هذا الإنجاز يعزز الفكرة أن دمج تمثيلات مكملة يمكن أن يخلق مصنّفين أكثر كفاءة وقابلية للتعميم دون الحاجة إلى تدريب موسع.

لتفاصيل إضافية، يمكنك الوصول إلى الكود المصدري لكل من نموذج AudioFuse والنموذج الأساسي عبر GitHub: الرابط. في النهاية، هذا الابتكار الجديد يمكن أن يحدث فارقًا كبيرًا في مجال تشخيص أمراض القلب. ما هي توقعاتكم حول مستقبل تقنيات الذكاء الاصطناعي في الرعاية الصحية؟ شاركونا في التعليقات!