في عالم يتسارع فيه تطور التكنولوجيا، أُطلق مؤخرًا FinEvo-Bench، وهو بنش مارك مبتكر يهدف إلى قياس فعالية وكلاء الذكاء الاصطناعي (AI Agents) في ظل بيئات العمل المالية الواقعية. يختلف هذا البنش مارك الجديد عن سابقاته من حيث منهجيته، حيث يُقيِّم الأداء عبر مهام مترابطة، مما يمكّن من قياس كيفية استفادة الوكلاء من تجاربهم السابقة.

يتضمن FinEvo-Bench 120 مهمة واقعية تغطي 20 سيناريوًّا تجاريًا ضمن ستة مجالات مالية، حيث يُحدد الإجراءات المطلوبة والشروط من قِبَل المؤسسات. هذا التصميم يمنح الوكلاء فرصة للاعتماد على معلومات مستندة إلى حالات مُعروفة وأرقام فعلية، مما يعزز من مصداقية التقييم.

كما يُقارن الدراسة بين أربعة أنواع من الوكلاء الذكيين الذين يعتمدون على نواة Qwen3.7-Max، وتأثير تطورهم الذاتي عند العمل على مهام مرتبطة على صعيد الاحترافية. من بين النتائج المثيرة، حصل نموذج Letta على أعلى نقاط تطور (91.65) وأقل مشكلات في الامتثال، بينما حقق نموذج Codex أعلى زيادة في التطور الذاتي (+19.37).

تشير النتائج إلى أن حالة التطور الذاتي تؤدي إلى تحسين الأداء بصورة ملحوظة، حيث ارتفعت النقاط بمقدار يتراوح بين 9.33 و19.37 نقطة، وتم تقليل مشكلات الامتثال بنسبة تتراوح بين 0.12 و0.44 لكل مهمة.

إن FinEvo-Bench لا يقيس فقط الأداء المهني، بل يقيّم أيضًا قدرة التطور الذاتي لدى الوكلاء، مما يُعَدُّ خطوة فارقة نحو تحقيق ذكاء اصطناعي أكثر كفاءة وفعالية.