في عالم الذكاء الاصطناعي، تعتبر الثقة أمرًا محوريًا يجب أخذه بعين الاعتبار عند تقييم أداء الوكلاء الذكيين. هنا يأتي دور AgentAudit، الإطار المفتوح والقابل للتوسيع الذي يوفر تقييمًا شاملًا لثقة الوكلاء الذكيين على مدار حياتهم. بينما كانت الأطر السابقة تركز على أجزاء محددة فقط، مثل إكمال المهام أو قوة الأمان، يقدم AgentAudit تحليلاً متكاملاً يغطي جميع مراحل التنفيذ، بدءًا من التخطيط، وانتقاء الأدوات، وصولًا إلى التنفيذ والتقييم الذاتي.

يسلط AgentAudit الضوء على عشرة أبعاد رئيسية تشمل نزاهة التعليمات، التخطيط، الذاكرة، اختيار الأدوات، صحة الأدوات، التوافق، الأمان، ونزاهة التنفيذ. ومن خلال هذا التحليل المتعدد الأبعاد، يتمكن من تحديد المرحلة المسؤولة عن أي فشل يحدث.

يتيح AgentAudit تقييم أي وكيل يعتمد على نماذج لغوية ضخمة (Large Language Models)، حيث يتم ربطه بالوكيل بدلاً من استبداله، مما يحافظ على كيفية عمل الوكيل دون أي تدخل. في دراسة قام بها، تم تقييم خمسة نماذج لغوية (OpenAI GPT-5، Claude Sonnet 5، Sarvam 105B، Llama 3.3 70B، وGemini 2.5 Flash) عبر تسع مهام capabilities و adversarial tasks. حيث أظهرت النتائج أن Claude Sonnet 5 وGPT-5 حصلا على أعلى درجات في Composite Trust Scores (95.1 و80.6 على التوالي)، بينما جاءت النماذج الأخرى بمعدلات متدنية جداً.

تظهر هذه النتائج أن النماذج التي تتمتع بسلوك مشابه في إتمام المهام قد تختلف كثيرًا في موثوقيتها، مما يجعل تقييم الثقة مطلباً أساسياً يتجاوز الجمود في اختبارات النجاح والفشل. سيكون دور AgentAudit محوريًا في المستقبل لزيادة مدى ثقة المستخدمين في الوكلاء الذكيين، ولذا يُعتبر خطوة متقدمة في مجال تقييم الذكاء الاصطناعي.