في ظل التزايد المستمر لاستخدام نماذج اللغة الضخمة (Large Language Models) في مختلف المجالات، أصبحت دقة تقدير الثقة ضرورة ملحة لضمان موثوقية هذه النماذج. تعتمد معظم الأبحاث السابقة على تقدير الثقة من مستوى الاستجابة، حيث تتمثل هذه الطريقة في تقييم صحة الناتج المستخرج من النموذج.

مع ذلك، يظهر أن هذه المنهجية لا تتماشى مع العديد من الإعدادات العملية، حيث تعتبر المسألة المركزية هي كيفية تقدير قدرة النموذج على حل الاستفسارات بشكل عام. ونتيجة لهذا التباين، يتم تقديم مفهوم جديد يعرف بـ"معايرة القدرة" (Capability Calibration) - وهو إطار تقييم جديد يركز على قياس مدى توافق تقدير الثقة على مستوى الاستفسارات مع دقة النموذج المتوقعة.

تم توضيح الفرق بين معايرة القدرة ومعايرة الاستجابة، حيث أن الاختلافات بينهما ليست فقط نظرية بل تجريبية أيضاً. وتُظهر الأبحاث أن معايرة القدرة أكثر ملاءمة للتطبيقات مثل توقع النجاح وتخصيص ميزانية الاستدلال. أخيراً، أُجريت تقييمات لأساليب تقدير الثقة الشائعة لفهم جدوى تطبيق معايرة القدرة في العالم العملي.

إن هذه النتائج تحمل في طياتها إمكانيات مثيرة لاستخدام نماذج اللغة الضخمة بطرق أكثر دقة وموثوقية، مما يعزز من قدرتها على تلبية احتياجات المستخدمين الفعلية.