في عالم الذكاء الاصطناعي (AI)، يتم تقييم أداء الوكلاء بناءً على إجاباتهم النهائية، ولكن ما الذي يحدث عندما يتفاعل هؤلاء الوكلاء مع بيئات ديناميكية؟ في هذا السياق، تم تقديم ClawProBench، أداة تقييم فريدة تهدف إلى تصحيح مسار التقييم التقليدي الذي يركز فقط على النتائج النهائية.

يقترح مطورو ClawProBench ، أن العناصر الأساسية لتقييم أداء الوكلاء هي تكوين النموذج إلى جانب بيئة التشغيل. الفشل في تسليم النتائج يمكن أن يحدث في جمع الأدلة، توجيه التشغيل، حدود السلامة، أو حتى أثناء التنفيذ المتكرر.

تعمل ClawProBench، التي تم تطويرها باستخدام OpenClaw، على تسخير بيئات العمل الحية توفر أدوات تصفح، ذاكرة، رسائل، جدولة، مهارات، ووكلاء فرعيين. تنقسم الأداة إلى مسارين: الأول يتضمن 102 سيناريو مع مهام متداخلة في بيئة عمل حقيقية، بينما يركز الثاني على 68 سيناريو مغلق مع عقود خروج بتنسيق JSON لتعزيز موثوقية التقييم.

يتم تقييم الأداء من خلال تتبع تنفيذ العمليات باستخدام صيغة خاصة تأخذ في الاعتبار الصحة، ومعايير الجودة والكفاءة. في تجارب حديثة، تم تقييم 68 تركيبة باستخدام المسار الكامل و37 باستخدام المسار المغلق، حيث سجلت النتائج متوسط ​​درجات تتجاوز 0.7671.

لكن التفاصيل تبرز أن المهام المدارة محليًا تؤدي أسوأ من المهام الحية، مما يجعلنا نتساءل عن قوة الوكلاء عند مواجهة بيئات متقدمة. نتائج التقييم تشير إلى أن التقييم القائم على الصحة يختلف بشكل كبير عن المنظور الذي يراعي العمليات والمعايير الأمنية.

في النهاية، قد تكشف العلامات التجارية النهائية عن عيوب في الأداء، مما يعني أن الأبحاث والتقييمات المستقبلية يجب أن تتعامل بعناية مع هذه الجوانب لإنتاج وكلاء أكثر كفاءة وفعالية في بيئات مختلفة.