في عالم يتجه بخطىً سريعة نحو الاعتماد على الذكاء الاصطناعي (Artificial Intelligence) في المجالات الطبية، قد يبدو من الصعب تقييم مدى فعالية هذه النماذج. لذلك، اقترحت دراسة حديثة منهجية تقييم جديدة ترتكز على صلاحية (Validity) النتائج، وهي خطوة مبتكرة ومهمة في هذا المجال.

تُركز هذه المنهجية على بيانات وتقييمات نماذج لغوية طبية (Biomedical LLMs) حيث يكون الحكم البشري القائم على الجودة محدودًا. وبينما تُستخدم النماذج التقليدية للقياس، تم إضافة تحورات محددة منقّحة تُنتج أزواج مفضلة يمكن تدقيقها، مما يُعزز عملية التقييم.

تتمثل الأبعاد الثلاثة الرئيسية لتقييم هذه النماذج في: 1. الصحة مقابل الملصقات الذهبية المُستمدة من المعايير، 2. القوة في ظل عمليات السحب العشوائي المتكررة، و3. الالتزام مع صيغة المخرجات المطلوبة.

تمت تجربة هذه المنهجية مع نموذج Llama-3.1-8B-Instruct في أربعة أنماط مختلفة، حيث أظهر النمط المرتكز على التعلم المعزز (Reinforcement Learning) بعد التعلم المُراقب (Supervised Fine Tuning) الأداء الأفضل على صعيد الصحة والامتثال والقوة، موضحًا تفوقه في المهام التحليلية المعقدة مثل استخراج PICO والعمليات الحسابية السريرية.

في ختام هذا المقال، يتضح أن النتائج تشير إلى إمكانية تقدم نماذج الذكاء الاصطناعي في مجالات الطب الحيوي، وهذا يفتح آفاقاً جديدة لتطوير تقنيات أكثر فعالية واستجابة لمتطلبات السوق الطبي.