تسير نماذج اللغة العملاقة (Large Language Models) بمسيرة متسارعة، وتجد نفسها في مواقف تتطلب دقة عالية، حيث يمكن أن تكون الإجابات غير الصحيحة مكلفة للغاية. ولذا، لم يعد قياس الدقة بمفرده كافياً، إذ أصبح من الضروري أن تعرف هذه النماذج متى تكون أخطاؤها محتملة.

**Introducing ConfidenceBench**
يسعدنا تقديم ConfidenceBench، معايير جديدة تقيم تقديرات الثقة اللفظية في 15 من أحدث نماذج اللغة العملاقة باستخدام مقياس Brier، والذي يعد قاعدة تقييم صحيحة تشجع على الإبلاغ الواضح عن الاحتمالات. يُستخرج هذا القياس من خلال التنبيه، مما يعني عدم الحاجة للوصول إلى بيانات قدرات النموذج، مما يجعل هذا الإطار قابلاً للتطبيق على الأنظمة المغلقة والمفتوحة المصدر.

يتضمن المعايير 200 سؤال متعدد الخيارات موزعة على أربع فئات: التفكير المكاني، الرياضيات الدقيقة، بحث الكلمات، والأسئلة غير القابلة للطعن. وعبر ثلاث تجارب مستقلة، حقق كل من Claude Opus 4.6 وGemini 3.1 Pro Preview أدنى درجات Brier، حيث سُجلت كل منهما عند 0.103.

وتفوق كلاهما بشكل ملحوظ على الخط الخلفي العشوائي البالغ 0.1875، بينما سجل Gemini 3.1 Flash-Lite درجة 0.367، مما يدل على عدم تطابق كبير.

تظهر النتائج أن قياس الثقة اللفظي يعد محورًا مهمًا من محاور موثوقية نماذج اللغة العملاقة، وهو مكمل تقييم الأداء بناءً على الدقة التقليدية. فبينما يمكن أن يكون النموذج الأكثر دقة ليس الأكثر تأهيلاً من حيث الثقة، فإن العديد من النماذج قد تؤدي بشكل أسوأ من القاعدة العشوائية بينما تحتفظ بدقة معقولة. إذًا، هل سنرى في المستقبل نماذج أكثر موثوقية تعتمد على مثل هذه المعايير؟

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.