من المعروف أن الاعتماد على الدقة فقط لتقييم موثوقية نماذج الذكاء الاصطناعي (AI) يمثل تحديًا كبيرًا. حيث تقترح دراسة جديدة أنه يجب قياس تكلفة التحقق (Verification Cost) بدلاً من الاعتماد على الدقة البحتة. في عالم الذكاء الاصطناعي، تعتمد نتائج النماذج التوليدية على مدى الجهد المطلوب للتحقق من تلك النتائج.

هذه الدراسة، المنشورة على arXiv، تثير نقطة هامة تتعلق باتجاهات التقييم الحالية، حيث تشير إلى أن المقاييس التقليدية تتجاهل نوعًا حرجًا من الأخطاء يعرف باسم أخطاء تكلفة التحقق (Verification-Cost Errors أو VCEs). هذه الأخطاء تشير إلى الأزواج غير الصحيحة من المدخلات والمخرجات التي يفشل جزء معين من المراجعين في تحديدها ضمن الميزانية المتاحة للتحقق في سياق معين.

بالإضافة إلى ذلك، يُتوقع من المراجعين أن يتمكنوا من التعرف على النتائج الصحيحة، لكن عندما تُفرض قيود زمنية أو موارد، تصبح هذه المهمة أكثر تعقيدًا. ولذلك، بدلاً من اعتبار "الهلاوس" التي قد تظهر في محادثات الذكاء الاصطناعي كتعريف محدد للأداء، يتم تعريف أخطاء تكلفة التحقق بشكل عملي، استنادًا إلى فشل التعرف الصحيح ضمن الميزانية بدلاً من أي خاصية للنتيجة نفسها.

تشير النتائج المستخلصة من توليد الأكواد وفهم الوثائق متعددة الأنماط إلى أن الدقة العالية في المعايير قد تخفي جهد تحقق كبير في الواقع العملي. بناءً على هذه الرؤية، نرى أن الدقة وحدها لا تكفي كمعيار للموثوقية. يجب أن تتضمن عمليات تقييم الذكاء الاصطناعي تكلفة التحقق بشكل صريح، مما يعكس ما إذا كانت الأخطاء يمكن اكتشافها تحت قيود الموارد الواقعية.