تظهر البيانات الحديثة أن السجلات الصحية الإلكترونية أصبحت تعبر عن ثورة في مجال الرعاية الصحية، حيث يمكن أن تحتوي سجلات كل مريض على أكثر من 100,000 كلمة. ومع ذلك، يواجه الباحثون تحدياً جديداً يتمثل في التأثير المعروف بـ «فقدان المعلومات في المنتصف» (Lost-in-the-middle effect). هذا التأثير يعني أن المعلومات الموجودة في منتصف السياق الطويل تُسترجع بشكل أقل موثوقية مقارنة بالمعلومات الموجودة على الأطراف.

وقد يكون لهذا التأثير عواقب وخيمة في التطبيقات السريرية، حيث يمكن أن تتواجد المعلومات الأكثر أهمية في قلب النص. وقد حدد الباحثون هذه المشكلة الهامة التي أسموها "مشكلة فقدان المعلومات السريرية في المنتصف" (Clinical Lost-in-the-Middle Problem)، وعملوا على تقديم أول تعريف منهجي لها باستخدام أداة MedAlign.

أظهرت الدراسة مقارنة لاستراتيجيات اختيار السياق المختلفة كحلول لتقليل أثر فقدان المعلومات. من خلال تحليل 2,196 زوجاً من التعليمات والأجوبة باستخدام ستة نماذج لغوية، لوحظ وجود فجوة كبيرة بنسبة 21.9 نقطة مئوية بين أعلى دقة (59.5%) وأدنى دقة (37.6%)، حيث 67.8% من الإجابات المرجعية تقع بين النسب المئوية 10 و90% من جدول الزمن الخاص بالسجل الصحي.

للتغلب على هذه المشكلة، قام الباحثون بتقديم تقنية جديدة تُعرف باسم "إسكات السجل السريرية المعتمدة على الاستعلام" (Query-Conditioned Clinical Suppression أو QCCS)، التي تعد بوابة لتحديد السياق، وتقييم أدائها مقارنة بأساليب استرجاع المعلومات المعروفة مثل BM25. أظهرت النتائج أن QCCS تتفوق على جميع المقارنات الخمسة تحت نظام تقييم LLM-as-judge، حيث وصلت إلى دقة 16.7% مقابل 3.3% لـ BM25.

تقدم هذه الدراسة دليلاً على أن اختيار السياق المعتمد على الاستعلام يمكن أن يتنبأ بدقة اتباع التعليمات السريرية بشكل أفضل من استرجاع الجملة الذهبية، مما يبشر بإمكانيات كبيرة لتحسين استخدام الذكاء الاصطناعي في الرعاية الصحية.