في عصر النماذج اللغوية الكبيرة (Large Language Models) التي غزت مختلف المجالات، يُقدم الباحثون أداة قياسية جديدة تُدعى E-Bench، والتي تهدف إلى تقييم قدرة الوكلاء الآليين على استخدام الأدوات عبر خطوات متعددة في بيئات حقيقية.

تتناول E-Bench 323 مهمة متغيرة الحالة ضمن ثلاثة مجالات منتجات مميزة: "Honor of Kings"، "QQ Music"، و"Tencent Meeting". تتيح هذه الأداة تقييم أداء الوكلاء بطرق جديدة، حيث تفصل بين توليد البيئة وتوليد المهمة، مما يمنح الباحثين القدرة على التحكم والتوسع بشكل أفضل.

تواجه الأدوات الحالية التحديات عند تقييم الوكلاء، حيث تركز معظمها على استدعاءات API المعزولة أو مجموعات قصيرة من المهام، ما يجعل من الصعب تحقيق تقييم شامل وواقعي. عبر استخدام E-Bench، يُمكن الآن لباحثي AI تقييم كيف يتغلب الوكلاء على الفجوات في المعلومات والأدوات، مما يحتم عليهم اكتشاف بيانات مخفية وتركيب استدعاءات متعددة للأدوات قبل إحداث أي تغييرات.

ورغم إنجازات E-Bench، تشير النتائج إلى أن التحديات مستمرة. أظهرت النتائج الأولية التي تم الحصول عليها من اختبار 11 نموذجًا لغويًا متقدمًا أن معدل النجاح يبقى دون 60% للنماذج الأقوى، حتى مع وجود إمكانية تنفيذ الكود في E-Bench-Code، ولم يتجاوز معدل الاعتماد 70%. يُظهر هذا أن استخدام الأدوات المتعددة الخطوات لا يزال يتطلب المزيد من الجهد والابتكارات لحل المشكلات المعقدة.

بينما تطور E-Bench الطريقة التي نقيم بها الأداء في بيئات ديناميكية، فهو أيضًا يبعث برسالة هامة حول التحديات التي يواجهها مجال الذكاء الاصطناعي. كيف ترون مستقبل استخدام النماذج اللغوية الكبيرة في مثل هذه المهام المعقدة؟ شاركونا آرائكم في التعليقات!