في عالم الذكاء الاصطناعي، أصبحت نماذج اللغات الضخمة (Large Language Models) قادرة على حساب الالتزامات الضريبية بشكل دقيق في أكثر من 90% من الحالات المصممة جيداً. هذا الأمر جعلها مرشحة مثالية للاستخدام في أنظمة المشورة الضريبية والامتثال، حيث يمكن أن تقدم إجابات فورية.

ومع ذلك، لا تكون المدخلات القانونية دائماً خالية من العيوب، حيث يمكن أن تكون هناك حقائق مفقودة أو تناقضات مذكورة. فنجاح النماذج في الاختبارات النظيفة لا يعكس بالضرورة أدائها عند مواجهة مدخلات غير صحيحة. إذا كانت المدخلات تتضمن تناقضات، فإن النظام قد يُرجع نتيجة واثقة دون أي إشارة تدل على وجود خطأ.

هذا يثير تساؤلين مهمين: هل تتوقف النماذج عن العمل عند وجود مدخلات معيبة؟ وإذا لم تفعل، هل يمكنها التعرف على تلك العيوب عند الطلب منها التحقق من المدخلات؟

أجرينا دراسة على ستة نماذج حديثة، مع حالات ضريبية مستمدة من SARA، حيث تم تقديم حقائق مفقودة وحالات تناقض. أظهرت النتائج أن أفضل النماذج تتوقف عن الحساب عند وجود حقيقة مفقودة لكنها تستمر في حساب الإجابات عند وجود تناقضات، حيث تعيد الاعتماد على الإجابة الصحيحة في 63-76% من الحالات دون أي إشارة على الصراع.

وعندما طُلب منها التحقق من نفس المدخلات، كانت هذه النماذج تُشير إلى معظم تلك التناقضات. وقد قمنا بدمج هذا التحقق في نظام بسيط للتمييز عن التناقضات: طلب إضافي واحد يتوقف عند الإبلاغ عن تناقض.

في النهاية، يُظهر التحليل أن دقة النماذج في المدخلات الجيدة هي مقياس غير مكتمل للموثوقية، وأن الاكتشاف الذي تفشل كل حلقة في تحقيقه يمكن استعادته بسهولة من خلال فحص ذاتي بسيط.

هذا التحليل يفتح آفاق جديدة لفهم كيف يمكن تحسين قاعدة بيانات الضرائب وضمان أداء أفضل للنماذج القائمة على الذكاء الاصطناعي.