في عالم الذكاء الاصطناعي وتحديداً في استخدام نماذج اللغات الضخمة (LLMs)، يصبح من الضروري أن نتمكن من تقييم ثقة الخوارزمية في نتائجها. يتطلب الأمر فهماً دقيقاً للكيفية التي تستند بها النماذج إلى نجاحاتها، حيث تكون الأدلة متوزعة عبر مراحل متعددة داخل مسار العمل.

تواجه عمليات النماذج الحديثة العديد من التحديات، بما في ذلك القليل من المعلومات حول الإشارات الداخلية وارتفاع تكلفة النماذج الممتدة. في هذا السياق، تم تقديم مفهوم جديد يعرف برسوم بيانية لثقة الاستدلال (CRGs) كإطار زمني لتقدير احتمالية نجاح العميل.

يبدأ هذا الإطار بفكرة أنه قد تم إنجاز المهمة، ثم يقوم بتفكيك هذه الفرضية إلى مجموعة من الادعاءات الفرعية مستندة إلى الأدلة المستمدة من المسار، ويقوم بتقدير درجة الثقة لكل ادعاء نهائي، قبل دمجها في تقدير كلي للثقة.

تظهر النتائج عبر ثلاثة معايير نموذجية وبدائل متعددة أن CRGs تعزز من دقة تقديرات الثقة وتسمح بتحقيق قرارات مدروسة مع تقليل نسبة المخاطر بشكل كبير.

مما يثير الاهتمام أيضاً هو أن الخطأ في المعايرة وحده قد يكون مضللاً، حيث يتمكن الإطار CRG من تقييم الثقة بشكل أفضل من الأنظمة التقليدية. وفي ختام ذلك، يقدم CRG شفافية تتمثل في عرض الادعاءات والأدلة، مما يسمح بمراجعتها أثناء عملية اتخاذ القرار.