في العصر الحالي، تلعب نماذج الذكاء الاصطناعي دورًا محوريًا في معالجة وتحليل البيانات الطبية. لكن تبقى مسألة الترميز (Tokenization)، وهي عملية تحويل التسلسلات الزمنية للمرضى إلى رموز مفهومة، من بين التحديات الرئيسية التي تواجه الباحثين. دراستنا الأخيرة حول هذا الموضوع تكشف النقاب عن تجارب وخبرات هامة في تصميم هذه النماذج.

اعتمدنا في هذا البحث على نماذج مثل Llama و Qwen، حيث تم تدريب 156 نموذجًا باستخدام بيانات شاملة حول حالات الاستشفاء. قمنا بتقييم الأداء خلال الساعات الأولى من الاستشفاء، وقد أظهرت النتائج أن تحسين الترميز من خلال دمج الرموز مع القيم ساهم في زيادة فعالية النماذج بشكل ملحوظ، مع تحسن في قياسات الأداء مثل زيادة في معدل التحليل المتبادل (AUROC).

تزامن ذلك مع اختبار تقنيات جديدة، مثل استخدام ترتيب الأحداث ومواضع أدنى التقديرات، حيث أظهرت هذه الطرق نتائج أفضل مقارنة بالطرق التقليدية. كما أظهرت مقارنات بين بيانات استشفاء أصلية وبيانات مأخوذة من نموذج البيانات الشامل CLIF أن النماذج التي تعتمد على بيانات CLIF كانت أكثر فعالية في معالجة الاستجابات السريرية المقاسة.

تعد هذه النتائج مؤشرًا قويًا على أهمية اتخاذ قرارات استراتيجية حول الترميز وتشفير الأحداث، الأمر الذي يؤثر بشكل كبير على قدرة النماذج في التصنيف والتنبؤ في مجال الرعاية الصحية. ينتظر المستقبل رحلات مثيرة للاهتمام في هذا المجال، مما يثير تساؤلات كثيرة حول كيفية تحسين طرق تصميم هذه النماذج.