في عالم الرعاية الصحية، تمثل الأخطاء الطبية تحديًا كبيرًا، خاصة في النصوص السريرية. بينما تُظهر نماذج اللغة الكبيرة (Large Language Models - LLMs) تعدد استخداماتها في مجالات الطب، إلا أن قدرتها على اكتشاف وتصحيح الأخطاء لم يُقيّم بشكل كافٍ. هنا يأتي دور MedRECT، معيار جديد وأول من نوعه يركز على اللغة اليابانية والإنجليزية.

يوفر MedRECT نموذجًا لتقييم قدرة نماذج الذكاء الاصطناعي على معالجة الأخطاء الطبية من خلال ثلاثة مهام رئيسية: اكتشاف الخطأ، استخراج جمل الخطأ، وتصحيح الخطأ. يتضمن معيار MedRECT-ja حوالي 663 عينة مأخوذة من امتحانات الترخيص الطبي اليابانية، بينما يتضمن MedRECT-en 458 عينة مُختارة من مجموعة MEDEC.

مع تقييم 11 نموذجًا من نماذج اللغة الكبيرة عبر 17 تكوينًا مختلفًا، حقق نموذج Qwen3-32B أداءً متميزًا أعلى في وضع التفكير مقارنة بوضع عدم التفكير، حيث ارتفاع نسبة دقة استخراج الجمل تصل إلى 24.5 نقطة مئوية في المجموعة اليابانية و10.3 في المجموعة الإنجليزية. هذا يظهر أن النماذج الشائعة في الاستخدام العام تتفوق على ثلاثة نماذج متخصصة في المجال الطبي في هذين المجالين.

علاوة على ذلك، توفر عملية ضبط LoRA الدقيقة (LoRA Fine-tuning) نتائج أفضل في دقة استخراج الجمل ونتائج عالية على جميع مقاييس التشابه التصحيحية المعتمدة على المراجع في كلا اللغتين. يُعتبر MedRECT مورد تقييم مفتوح وقابل لإعادة الاستخدام لدراسة تصحيح الأخطاء الطبية والتفكير في مجالي اليابانية والإنجليزية. لمزيد من المعلومات، يمكن الوصول إلى مجموعة البيانات والشيفرة المصدرية عبر GitHub.

إن هذا التطور في مجال الذكاء الاصطناعي يُعتبر خطوة هامة نحو تحسين نظام الرعاية الصحية. ما رأيكم في هذا المشروع الرائد؟ شاركونا أفكاركم وتجاربكم في التعليقات!