في عالم الألعاب الإلكترونية، يُعتبر Minecraft من بين العوالم الأكثر شهرة حيث يتيح للاعبين إنشاء عوالمهم الخاصة واستكشاف أبعاد جديدة. ومع توفر نماذج اللغة الكبيرة (Large Language Models) ابتكر باحثون مشروعًا جديدًا يُدعى MirrorCraft، والذي يهدف إلى تطوير طرق تقييم أداء الوكلاء الذكيين (AI Agents) في هذا السياق الفريد.

تعمل معظم المعايير الحالية على تقييم أداء الوكلاء استنادًا إلى قواعد ثابتة ومحددة مسبقًا. لكن تلك الطريقة لا تعكس كيفية استجابة الوكيل للتغييرات التي قد تطرأ على قواعد اللعبة المعروفة. هنا يتدخل مشروع MirrorCraft كحل مبتكر، حيث يوفر معايير تقييم جديدة تتفاعل مع تغييرات خفية في اللعبة.

يتألف كل عالم Mirror من نسخة مطابقة لعالم Vanilla، ويتم تعديل بعض القواعد من خلال حزم البيانات الخاصة. تظل السمات مثل التضاريس، مواقع الموارد، والأهداف متطابقة بين كل زوج من عوالم Vanilla وMirror. المشروع يشمل أيضًا خمسة أنظمة بيئية متحكم بها، وستة أنواع من قواعد اللعبة، وثلاثة أهداف تقدم، ونموذجين مختلفين، بالإضافة إلى ستة تكوينات من الوكلاء تحت واجهة Mineflayer المشتركة.

يمكّن هذا النظام من قياس تقدم المهام عبر مراحل تقدم محددة ونسبة النجاح، ويقدم طريقة مبتكرة لقياس التأثير الناجم عن تدخل القواعد (Rule Intervention Effect - RIE) بين العوالم المتطابقة. أظهرت التجارب أن التغييرات الخفية في القواعد تؤثر بشكل ملحوظ ويختلف هذا التأثير حسب الحُزم المستخدمة. كما أظهر نموذج ReAct أداءً متميزًا، محققًا أعلى درجات في MirrorCraft.

إن مشروع MirrorCraft لا يساهم فقط في تحسين تقييم الذكاء الاصطناعي، بل يفتح أيضًا آفاقًا جديدة لفهم كيفية تفاعله مع العوالم المتغيرة، مما يجعل منه أداة مثالية لدراسة التكيف والاستجابة للبيئات الديناميكية في عالم الألعاب.