في عالم الطب، تُعتبر دقة نماذج الذكاء الاصطناعي أمرًا حيويًا. نموذج Jev، الذي يعد نموذجًا غير توليدي، يُمثل تطورًا جديدًا في كيفية الإجابة على الأسئلة الطبية. في دراسة حديثة، تم تقييم أداء Jev 1.13 باستخدام أربعة معايير طبية بارزة: MetaMedQA، PubMedQA، DiagnosisArena-MCQ وتحديات NEJM.
تم اعتبار جهاز GPT-6 Sol، مع درجات متوسطة وبدون تفكير، كمرجع لتقييم Jev. كانت النتيجة الرئيسية هي دقة الإجابات، فيما تم تناول جوانب مثل التقديرات الانتقائية والتعرف على الأسئلة غير القابلة للإجابة.
أظهرت النتائج أن Jev حقق دقة مشابهة لجهاز GPT-6 Sol في اختبار PubMedQA، حيث وصلت النسبة إلى 78.4% مقابل 78.2%. ومع ذلك، كانت نتائج Jev أقل بشكل ملحوظ في اختبارات MetaMedQA وDiagnosisArena-MCQ وتحديات NEJM. حيث سجل Jev 74.8% في MetaMedQA مقارنةً بـ 82.7% لجهاز GPT-6، و59.8% في DiagnosisArena-MCQ مقارنةً بـ 82.4% لجهاز GPT-6.
على الرغم من أداء Jev، أظهر التقييم أنه يملك تقديرات أكثر دقة في الاختبارات الطبية الأخرى، حيث كانت النتائج دقيقة بنسبة 93.4% عندما كانت احتمالات الإجابة لا تقل عن 0.9. ومع ذلك، فإن مرونة Jev في التعرف على الأسئلة التي لا يمكنه الإجابة عنها كانت أقل من نظيره GPT-6.
مع الوقت المستغرق في الإجابة والذي يتراوح بين 0.27 و0.31 ثانية، بالإضافة إلى تكلفة منخفضة قدرها 0.08 دولار لكل 2,823 عنصر، يظل Jev نموذجًا سريعًا وغير مكلف. ولكن، يحتاج إلى مزيد من التقييم قبل أن يُعتمد في التطبيقات السريرية. ماذا تعتقد؟ هل تعتقد أن هذا النموذج لديه القدرة على تغيير كيفية تعاملنا مع المعلومات الطبية؟ شاركونا آرائكم في التعليقات.
تقييم مبتكر لنموذج Jev في الطب: كيف يقارن مع GPT-6 في تشخيص الحالات؟
أظهرت النتائج أن نموذج Jev لديه دقة مماثلة لجهاز GPT-6 في بعض التطبيقات الطبية، لكنه يعاني في مجالات أخرى. يحتاج إلى مزيد من التقييم قبل الاستخدام السريري.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
