في عالم الذكاء الاصطناعي، تلعب النماذج القرارية دوراً حيوياً في توجيه القرارات وتقليل احتمالية الخطأ. ولكن، هل هذه النماذج قادرة على تقييم ثقتها بنفسها بدقة؟ في دراسة جديدة تناولت نموذج Jev، تم إجراء تقييم شامل لمدى فهمه الذاتي ومعرفته.

استخدم الباحثون أكثر من 15 مجموعة بيانات عامة و6 مهام مختلفة لتقييم أداء Jev في مواقف متنوعة. رغم أن Jev أظهر دقة عالية في المهام المغلقة والمعروفة، فقد كشفت النتائج عن قدرات متدنية عندما يتعلق الأمر ببعض الأسئلة المعقدة. على سبيل المثال، عند عدم وجود معلومات تتعلق بالإجابة، قد تمنح Jev ثقة تصل إلى 0.80 عندما يتعلق الأمر باختيار بارز، وهذا أمر مقلق لكل من يعتمد على هذا النموذج.

بالإضافة إلى ذلك، حينما تكون المعلومات موجودة على الحدود المعرفية، فإن الفجوة بين الثقة والدقة تتراوح بين 0.21 إلى 0.33، مما يعني أن إعادة تهيئة النموذج لم تغلق هذه الفجوات. إثارة تساؤل حول معرفة Jev بالإجابة قد يكشف عن معلومات مزيفة أو أخبار جديدة، ولكن لا يوجد تحسين فعلي عند تغيير الأسماء أو إزالة التواريخ.

تتطلب العمليات الحاسوبية ذات السطح الأسود (Black-Box) إجراء تدقيقات دقيقة تضمن إعداد ضوابط واضحة للحصول على معلومات موثوقة. فهل نحن مستعدون لتقبل هذه الفجوات في المعرفة عند اتخاذ قرارات مستندة إلى الذكاء الاصطناعي؟ انضم إلى النقاش حول مدى موثوقية هذه الأنظمة الحديثة!