في ظل التحديات المتزايدة التي تواجهها أنظمة المعلومات الصحية والبيانات المركبة، يبرز تحليل البيانات متعددة الجداول كأحد أهم ميادين البحث في مجال التعلم الآلي. تُعد البيانات العلائقية (Relational Data) مصدرًا لتعقيدات متعددة، تشمل حجم البيانات الكبير، المتغيرات عالية الأبعاد، وخصائص الفئات ذات الكاردينالية العالية، والعلاقات المعقدة بين الجداول.

لقد تم تقديم نموذج "محول الهيبرغرافي العلائقي" (Relational Hypergraph Transformer) كإطار معماري موحد يعالج هذه القضايا. يقوم هذا النموذج بتمثيل قواعد البيانات العلائقية كهيبرغرافات، مما يسمح له بتعلم تمثيلات متعددة الأبعاد (PentE) وتنفيذ انتباه علائقي متفرق. ما يميزه هو أنك تستطيع تقليل التعقيد الحسابي بما يتناسب مع متوسط درجة العلاقة بدلاً من مربع عدد الكيانات.

لقد قمنا بعمل تقييم للنموذج باستخدام مجموعة بيانات سجلات الصحة الإلكترونية الاصطناعية (Synthea) مع تطبيق مهم في توقع الأكواد الشرطية لـ "SNOMED CT". أظهرت النتائج تفوق نموذج محول الهيبرغرافي العلائقي، حيث أنتج تمثيلات أكثر توافقًا دلاليًا مع الحفاظ على القدرة القابلة للتوسع في الحساب.

بينما أظهر نموذج "XGBoost" أعلى معدل استرجاع للأكواد النادرة، إلا أن نموذج RHT حقق توافق دلالي أقوى. كما أجرينا دراسات تحليلية تساهم في فهم كل مكون من مكونات الإطار المعماري. ومن المخطط إجراء تحقيقات سريرية على قاعدة بيانات "MIMIC-IV" بعد الحصول على اعتماد "PhysioNet".

تتناول هذه الابتكارات مجموعة من المشكلات السابقة، مما يفتح الأبواب لفرص جديدة في معالجة البيانات وتحليلها في مجالات عدة.