في خطوة ثورية نحو تحسين أداء وكالات الذكاء الاصطناعي (AI) في المجال السريري، كشفت دراسة حديثة أن هذه الوكالات قد تظهر عدم اتساق في الأفعال بينها عندما تتعامل مع مدخلات متطابقة. هذا الاكتشاف يأتي على خلفية استخدام مدرج اختبار جديد يسمى MedAgentBench، والذي يقيم هذه الوكالات بناءً على دقتها في تقديم النتائج.
تسجل الدراسة كيف أن الأداء قد يختلف بشكل ملحوظ رغم استخدام نفس المدخلات في أكثر من تجربة، وهو ما يعرف "إعادة التشغيل بنفس المدخلات". بينت النتائج أنه تحت نموذج يحتوي على 8 مليار معلمة وبحرارة 0.7، ظهر أن هناك مجموعة من 43 عملية ترتيب مختلفة على مدار خمس تجارب متطابقة.
من بين هذه التباينات، أظهرت النتائج أن 26 عملية كانت تصدر الأوامر في بعض التجارب وليس في الأخرى، و28 منها سجلت قيمًا مختلفة بشكل ملحوظ. على الرغم من وجود اختلافات في الأفعال، إلا أن المدرج لم يسجلها بشكل دقيق، حيث كشف أن 22 من مجموعات الأفعال الـ 43 حصلت على نفس النتيجة الفاشلة رغم السلوكيات المختلفة.
هذه الاكتشافات تدعو إلى إجراء تقييمات متكررة لقياس استقرار الأفعال، مما قد يساهم في تحسين أداء وكالات الذكاء الاصطناعي السريرية من خلال توفير تعليقات بيئية دقيقة تعكس النتائج الفعلية للأداء. إذًا، كيف ستتأثر الأبحاث المستقبلية في هذا المجال؟
ثورة جديدة في تقييم وكالات الذكاء الاصطناعي: دراسات تكشف عدم اتساق الأفعال بين التجارب المتكررة!
تظهر دراسة جديدة أن وكالات الذكاء الاصطناعي السريرية قد تصدر أحكامًا مختلفة على مدخلات متطابقة. تسلط النتائج الضوء على أهمية تقييم استقرار الأفعال لتحسين الأداء الدقيق للوكالات السريرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
