في رحلة عالم الذكاء الاصطناعي، قد يكون التركيز على نماذج اللغة الكبيرة (LLMs) كالسيف ذو الحدين؛ فقد أظهرت هذه النماذج أداءً يفوق البشر في الاختبارات الطبية القياسية، لكن الواقع الإكلينيكي يطرح تحديات جديدة. هنا يأتي دور MEDIC، الإطار الجديد الذي يقدم تقييمًا شاملًا يُركز على خمس أبعاد رئيسية لضمان جاهزية كفاءة نماذج LLMs في التطبيقات السريرية.
هدف MEDIC هو سد الفجوة بين القدرات النظرية والنفع الفعلي. يقدم هذا الإطار مؤشرات رائدة تكشف عن فجوات في القدرة عبر الاختبارات المختلفة، مما يساعد في اختيار النموذج الأنسب قبل إجراء تقييمات مكلفة. من خلال تحليل الآليات التشغيلية، يتم استخدام بروتوكولات تنفيذ محددة وإطار الاستجواب المتقاطع (Cross-Examination Framework - CEF) لتقييم دقة المعلومات ومعدلات الهلوسة دون الحاجة إلى مرجع نصي.
أنتج تحليل MEDIC تنبيهات حول الفروق الحرجة في الأداء، حيث أظهر وجود فجوة ملحوظة بين معرفة النماذج وقدرتها على تنفيذ المهام العملية، مثل الحسابات السريرية أو توليد استعلامات SQL. كما لوحظت تباينات بين السلامة السلبية (الرفض) والسلامة النشطة (الكشف عن الأخطاء)، حيث إن النماذج الضبطت لمعدلات رفض مرتفعة قد تفشل في تدقيق الوثائق السريرية بدقة.
تُظهر هذه النتائج أنه لا يوجد هيكل مُعين يتفوق على الجميع في كل الأبعاد، مما يُبرز الحاجة إلى نهج متنوع عند نشر نماذج الذكاء الاصطناعي في المجالات الطبية. للمزيد، يمكنكم زيارة قائمة MEDIC المتاحة للجمهور على الرابط https://hf.co/spaces/m42-health/MEDIC-Benchmark.
MEDIC: إطار متكامل يقيم كفاءة نماذج اللغة الكبيرة في التطبيقات السريرية
تقدم MEDIC إطار تقييم مبتكر يقيم قدرات نماذج اللغة الكبيرة (LLMs) في التطبيقات السريرية، مسلطًا الضوء على الفجوات بين المعرفة النظرية وتنفيذ العمليات. اكتشف كيف يمكن لتقييم MEDIC أن يغير مستقبل الرعاية الصحية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
