في خطوة متقدمة نحو تعزيز تطوير الألعاب الذكية، قدم الباحثون OpenGameEval، وهو إطار تقييم رائد مصمم لتقييم عملية تطوير الألعاب داخل منصة Roblox Studio. يعمل هذا الإطار على تشغيل نماذج لغوية على شكل عملاء (Agents) ضمن جلسات ألعاب يمكن إعادة إنتاجها، وتقييم كل عملية بناءً على فحوصات قابلة للتنفيذ تتعلق بالمشاهد المعدلة وأثناء جلسات اللعب المحاكية.

تقليديًا، تتطلب معظم مقاييس البرمجة الابتكارية استكشافات لكنها تقيم النجاح النهائي فقط في المهام. لكن OpenGameEval يغير ذلك من خلال فصل أدوات المراقبة عن أدوات التعديل ضمن مساحة العمل المكونة من ثمانية أدوات، مما يسمح بقياس الاستكشاف بشكل مباشر.

استطعنا قياس معدلات النجاح وسلوكيات الاستكشاف لثلاثة عشر نموذجًا متقدمًا عبر 84 مهمة جوهرية مُعدة يدويًا، مع 16 محاولة لكل مهمة. وتتسم هذه المهام بالطابع الصعب بالنسبة للنماذج الحالية، حيث استطاع أفضل نموذج حل 51.7% من المهام في محاولة واحدة و39.4% خمس مرات من أصل خمس محاولات، بينما لم يتمكن أي نموذج تم اختباره من حل ستة من تلك المهام.

تظهر النتائج أن النماذج المتقدمة تصل إلى معدلات نجاح متشابهة من خلال حل مهام مختلفة؛ إذ يؤدي تقسيم المهام حسب نوع العمل المطلوب إلى فروقات في الأداء، منخفضة بمقدار 5.0 نقاط مئوية في مهام كتابة النصوص، و12.5 نقاط في مهام تغيير المشاهد.

كما تتنبأ سلوكيات الاستكشاف ما إذا كانت العملية ستحقق النجاح. فعند تثبيت المهمة والنموذج، فإن عملية تتحقق من كل عنصر يلمسه حل مرجعي قبل اتخاذ إجراء، تسجل نجاحًا بزيادة 13.4 نقاط مئوية أكثر من العملية التي لا تتفقد أيًا منها في المهام المدفوعة بالمشاهد، و9.8 نقاط مئوية أكثر في المهام المدفوعة بالنصوص.

يتم إتاحة مجموعة المهام وملفات الموقع والتعليقات الخاصة بكل مهمة، بالإضافة إلى ملحق يمكنه تشغيل المهام داخل Roblox Studio والمدرج المحدث تحت ترخيص MIT على الرابط: https://github.com/Roblox/open-game-eval.

إذا كنت من عشاق تطوير الألعاب أو مهتمًا بالذكاء الاصطناعي، فلا تفوتوا متابعة نتائج هذا الإطار الثوري! ما رأيكم في هذا التطور؟ شاركونا في التعليقات.