في تطور ملفت لعالم الذكاء الاصطناعي، تم الكشف عن مشروع جديد يدعى WebChoreArena، الذي يمثل خطوة مهمة في كيفية تقييم وكالات تصفح الويب. يُشغل هذا النظام بواسطة نماذج اللغات الكبيرة (Large Language Models) ويعمل على محاكاة الأداء البشري في واجهات الاستخدام الرسومية، مما يتيح تمكين عملية أتمتة المهام الويب.

بالرغم من المحطات الهامة التي حققتها هذه الأنظمة، يثور تساؤل مهم: هل لا تزال المقاييس الحالية قادرة على تقييم قدرات الوكلاء المتزايدة القوة، خاصة في المهام الأكثر صعوبة؟

إجابةً على هذا السؤال، قدم الباحثون WebChoreArena كإضافة شاملة لـWebArena، حيث يستهدف تحديداً المهام الأكثر تعقيداً ويتطلب التعامل مع 532 مهمة تم إعدادها بعناية على مدار 300 ساعة. تشمل هذه المهام مهارات استرجاع وتتبع معلومات واسعة، طباعة رياضية دقيقة، وإدارة معلومات طويلة الأمد عبر عدة صفحات ويب.

علاوة على ذلك، يتم بناء WebChoreArena على أربع بيئات WebArena قابلة للتكرار لضمان التوافق الدقيق، مما يوفر مقارنة عادلة مع الأعمال السابقة. أكدت النتائج التجريبية أن تطور نماذج اللغات الكبيرة يقترن بتحسنات ملحوظة في الأداء على WebChoreArena. ومع ذلك، تبين النتائج أيضاً أنه حتى مع تطور نموذج GPT-5، لا تزال هناك مساحة كبيرة لتحسين الأداء مقارنة بـWebArena، مما يبرز التحديات المتزايدة في WebChoreArena.

في النهاية، من الواضح أن WebChoreArena ليس مجرد أداة جديدة، بل هو مؤشر قوي على تطور الذكاء الاصطناعي وقدرته على التعامل مع مهام أكثر تعقيدًا. هل أنتم مستعدون لمتابعة هذا التطور المذهل في تكنولوجيا الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!