في عالم مليء بالتحديات والابتكارات، يظهر معيار CivBench كأداة ثورية لتقييم أداء وكلاء الذكاء الاصطناعي في لعبة Civilization VI. بدءًا من فكرة المعايير التقليدية، قام الباحثون بتصميم CivBench ليكون معيارًا مفتوح المصدر يعتمد على بروتوكول نموذج السياق (Model Context Protocol أو MCP).

يمتاز CivBench بقدرته على تقييم الأداء على مدى 300 دورة، حيث ينتج الآلاف من استدعاءات الأدوات ضمن مساحة إجراءات واسعة، مما يتطلب تخطيطًا مستدامًا ومراقبة دقيقة للحالة وتنفيذًا تحت ظروف رؤية جزئية. تحتوي البيئة على 76 أداة من أدوات MCP وطبقة سردية تحول الحالة المرئية للعبة إلى نص منظم، مما يسهل فهم البيانات والتفاعل مع اللعبة.

تم استخدام CivBench لدراسة سلوك 23 نموذجًا مختلفًا من الوكلاء، لكن النتائج كانت بمثابة تجربة أولية وليست مرتبة بين النماذج. لذلك، تم تقديم مقاييس جديدة على مستوى الواجهة لتكون قابلة للقياس، مثل معدل المراقبة الاستباقية (Proactive Monitoring Rate أو PMR)، الذي يقيس مدى قيام الوكلاء باستفسارات بشأن الحالة الاستراتيجية الكامنة، ومقياس RAG@10، الذي يقيم تنفيذ الالتزامات المعلنة ضمن تخطيطهم خلال عشر دورات لاحقة.

أظهرت النتائج نمطين متكررين تحت بروتوكول اللعب المشترك. فبالرغم من وجود توجيهات في الأداة للاستفسار عن تقدم النصر كل 20 دورة، إلا أن الوكلاء كانوا يقومون بذلك فقط كل 30 إلى 75 دورة. كما أنهم غالبًا ما يفشلون في تنفيذ الالتزامات القريبة التي ذكروا أنها جزء من تأملاتهم التخطيطية.

تظهر هذه الأنماط حتى مع وجود الوصول إلى الأدوات والتوجيهات الصريحة، مما يشير إلى أنها انحرافات تحت التعليمات بدلاً من غياب القدرة. يمكنكم الوصول إلى البيئة والسيناريوهات والسجلات والمقاييس وخط أنابيب التحليل من خلال رابط المشروع على GitHub. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.