في عالم الذكاء الاصطناعي، حيث تزداد أهمية الأنظمة الوكيلة (agentic systems) بسرعة، تمثل AEVAL (التقييم الوكلي) قفزة نوعية في طريقة تقييم مهارات هذه الأنظمة. تقنيات الذكاء الاصطناعي الحديثة تعتمد بشكل متزايد على المهارات التي تُعتبر حزمًا قابلة للتثبيت من اللغة الطبيعية والبرمجة. ومع نمو مستودعات المهارات، أصبح من الضروري للمطورين الحصول على إشارات جودة تلقائية لكل تغيير يتم تطبيقه، لكن التقييم التقليدي اليوم يعتمد في الغالب على التجارب الشخصية والتقديرات الذاتية.

بدلاً من الطريقة القديمة التي تتطلب من المطورين سؤال الوكيل: "هل يمكنك تجربة هذه المهارة؟" ومراقبة عرض توضيحي لتشكيل انطباع شخصي، تقدم AEVAL نظام اختبار يعتمد على القواعد القابلة للتكرار. يتم تنبيه النظام بكل تغيير على المهارات، مما يؤدي إلى تشغيل اختبار ضد عقدة تقييم يحددها المطور عبر مُنفذ آلي، الذي ينتج إشارة جودة موثقة ومستندة.

من الجوانب الفريدة في AEVAL هو فصل العمل بين المُنفذ والمُقيم، ما يمنع حالة الفشل الشائعة: أن يقوم الوكيل بتصحيح نفسه خلال التنفيذ ثم يقيم نتائجه المُعدلة كثابتة. تشمل المساهمات الرئيسة لإطار العمل:

1. بروتوكول تقييم يعتمد على التغيير، مع عقود مخصصة لكل مهارة.
2. صياغة رسمية لتحيز التصحيح الذاتي كحالة فشل مستقلة.
3. فصل المُنفذ عن المُقيم مع قاعدة تقييم أولية وقواعد تتبع تصحيح الذات.
4. مخطط للاقتراحات التصحيحية المستندة إلى أدلة مستويات متعددة.

لقد تم اختبار AEVAL بنجاح على مهارات حقيقية في بيئة إنتاج عبر عدة مجموعات تطوير للوكالات، حيث يحول معدلات النجاح الوهمية إلى إشارات فشل قابلة للتكرار مع سجل مدقق لكل تصحيح يتم من قبل المُنفذ.