في عالم التطوير السريري، يعد اتخاذ القرار في ظل عدم اليقين أمراً معقداً ويتطلب تخطيطاً دقيقاً لمجموعة من التجارب مبنية على أدلة متنوعة. في دراسة جديدة، تم تناول هذا الموضوع من خلال تقديم استراتيجية طموحة لتطوير الأدوية في مجال الأورام. يُنظر إلى تطوير العلاجات كمشكلة اتخاذ قرار غير متصل، حيث يقوم العميل بتوقع محفظة التجارب السريرية التالية على مدار ستة أشهر من المعلومات المتاحة في وقت اتخاذ القرار.

لتحقيق ذلك، تم تجميع مجموعة بيانات زمنية تتضمن أكثر من 31,700 سجل بيانات متنوعة من المصادر العامة، بما في ذلك سجلات التجارب، مراجعات الجهات التنظيمية، ملفات الرعاة، بيانات الاستفادة، وعلم الأوبئة. تم تطوير 881 حالة قرار غير متصل على مدار 45 برنامجاً تاريخياً.

ثم تمت مقارنة أربعة أهداف غير متصلة: تقليد السلوك، تقليد السلوك المعتمد على المكافآت، تدريب المكافآت المكتسبة، والتعلم المعتمد على القيمة (Value-Based Implicit Q-Learning) مع أربعة نماذج لغوية كبيرة (Large Language Models) تتشارك في بنية استرجاع زمنية موحدة.

أظهرت النماذج المدربة بطريقة غير متصلة تفوقاً واضحاً على النماذج الأساسية، لاسيما في فترة ما بعد أغسطس 2025. وقد حقق تقليد السلوك المعتمد على المكافآت الأداء الأفضل، حيث حصل على نتيجة F1 بنسبة 46.2% مقابل 14.2% للأفضل بين الأدوات المستخدمة، وهو ما يشير إلى أن التعلم المنظم غير المتصل يمكن أن يساعد العملاء في التخطيط لتجارب سريرية بكفاءة أعلى.