في عالم يعتمد بشكل متزايد على المعلومات الدقيقة، تأتي نماذج اللغات الضخمة (LLMs) كأدوات فعالة في مجال التحقق من المعلومات. ومع ذلك، هناك تحدٍ رئيسي يواجه هذه الأنظمة: عدم القدرة على تقديم قرارات موثوقة في بعض الأحيان، مما يجعلها تصدر أحكامًا واثقة حتى عندما تكون الأدلة الداعمة ضعيفة أو متناقضة.

للتغلب على هذا التحدي، تم تقديم إطار العمل الجديد 'تقييم سلسلة الأدلة' (Evidence Chain Evaluation - ECE). هذا النظام يتيح إمكانية الامتناع عن الإدلاء بحكمٍ نهائي في حالات عدم اليقين بدلاً من فرض قرار صحيح/خطأ على كل ادعاء. الهدف هو تعزيز تركيز الأنظمة على تقديم الأدلة بشكل متوازن.

تحتوي الأنظمة المستخدمة على وكيل تحقيق يستخدم أدوات متطورة لجمع الأدلة من خلال البحث عبر الإنترنت ومراجع البحث، ثم يقدم حكمًا منظمًا مع مستوى عالٍ من الثقة ومعلومات دقيقة حول المصادر. وفقًا لمقياس ECE-Bench، حقق النظام دقة مقدارها 91.6%، مع مستوى تغطية بلغ 93.7% ودقة انتقائية للادعاءات المشمولة وصلت إلى 97.8%.

على الرغم من أن نموذج ECE لم يتفوق على أقوى معايير استرجاع الأدلة من حيث كفاءة المعايرة الكلية، إلا أنه أظهر توازنًا واضحًا بين دقة التنبؤ الانتقائي وضرورة الامتناع، مما يعزز من سلامة التعامل مع الأدلة الضعيفة.

إذا كنت مهتمًا بتقنيات التحقق الحديثة وكيف يمكن أن تؤثر على عالم المعلومات، فإن هذا النموذج يعد خطوةً هامة نحو تحسين الأمان المنطقي في تحليل البيانات. يمكنكم استعراض الكود الخاص بالنموذج عبر [رابط_الكود].