في عالم الذكاء الاصطناعي، يعد تقييم الأداء الوكيلي (agent benchmarking) من أبرز التحديات التي تواجه الباحثين. فهذه العملية ليست فقط معقدة، بل أيضاً مكلفة بشكل كبير مقارنة بالأساليب التقليدية المُستخدم في تقييم نماذج اللغات الضخمة (Large Language Models). ومع ذلك، فإن تقدم تكنولوجيا الذكاء الاصطناعي قد أتاح لنا فرصة مثيرة لتحسين كفاءة هذا التقييم عبر منهجيات جديدة، مثل DualViewEval.

تتضمن DualViewEval استراتيجيات مبتكرة تسعى إلى دمج العلاقات الناتجة مع العمليات. من خلال تحليل مسارات واسعة النطاق، تم تحديد ستة إشارات عملية مكملة تُظهر بوضوح ارتباطها بأداء الوكيل النهائي. وبفضل ذلك، يمكن فصل التكرار في الأداء من منظور شامل، مما يسهل التنبؤ بدقة بنتائج القياس الكاملة.

لقد أظهرت الأبحاث أن DualViewEval تُحقق نتائج غير مسبوقة عبر خمسة معايير رئيسية للوكالات، حيث نجحت في تقليص عدد المهام من 20 إلى 40 مرة على نماذج APEX-Agents وBFCL. هذا التحسن لم يقتصر فقط على تقليل الهامش المطلق للخطأ (MAE) بمعدل يتراوح بين 14.5% و28.2%، بل عزز كذلك من توافق كيندال (Kendall's τ) بنسبة تصل إلى 7.2% مقارنة بأساليب القياس الأخرى.

تُظهر هذه النتائج إمكانية اختيار مجموعات مصغرة تمثل الفروقات في القدرات بين الوكلاء المختلفين، مما يوفر ملاحظات تشخيصية مهمة لتطوير نماذج وكيل أكثر كفاءة. بفضل تعلم العلاقات المزدوجة، يمكن لمطوري الذكاء الاصطناعي الآن الاستفادة من أداة قوية تفتح آفاقًا جديدة في عالم القياس والتقييم.