في عالم الذكاء الاصطناعي، تعد دقة الإجابات وجودتها أمرًا بالغ الأهمية، لا سيما في المجالات الحساسة مثل الطب والمقاييس الرياضية. وقد أظهر تحليل جديد أنه رغم أن الإجابات التي تولدها أنظمة الذكاء الاصطناعي (AI) قد تبدو سلسة، فإن التحقق من دقتها يعد تحديًا كبيرًا. لذلك، تم اقتراح إطار جديد يعتمد على الاستدلال لتدقيق إخراج نماذج اللغة الكبيرة (Large Language Models) بحيث يمكنه تقديم تقييم مرن وموثوق.

يعمل هذا الإطار من خلال تفكيك مسار الاستدلال المُولد إلى أجزاء أصغر، حيث يتم تصنيف العلاقات بين الفرضيات والأهداف باستخدام استنتاج اللغة الطبيعية (Natural Language Inference) وتنظيمها في رسم بياني معقد (Hypergraph). وبفضل البحث التكراري العكسي، يتم تعيين تسميات تدقيق على مستوى الأجزاء، مما يمكّن الباحثين من رؤية كيف يتم استناد كل جزء ضمن الرد المُولد.

لتقييم هذا الإطار، تم استخدام نموذجين فعليين: الأول يتعلق بالاستدلال الرياضي الاستنتاجي مع مجموعة بيانات Hard2Verify، والثاني يتعلق بالاستدلال الطبي المفتوح مع مجموعة بيانات UroReason الجديدة التي تم تعديلها بواسطة أطباء. أظهرت النتائج أن إطار التدقيق الجديد يوفر إشارة تقييم أكثر موثوقية مقارنة باستخدام نماذج الذكاء الاصطناعي كمُقيمين.

تسليط الضوء على نتائج هذه الدراسة يشير إلى ضرورة اعتبار كيفية تشكيل العلاقات الاستدلالية عبر مسار الاستدلال وعدم الاعتماد فقط على الإجابات النهائية أو اعتبار نماذج اللغة كجهات للتحقق. كما أن مجموعة بيانات UroReason ستصبح متاحة عبر واجهة برمجية (API)، وسيتم إصدار الشيفرة المصدرية كمصدر مفتوح، مما يفتح آفاقًا جديدة للباحثين والمطورين في هذا المجال.