في عالم الألعاب، يتساءل الكثيرون: هل يمكن لوكلاء البرمجة (Coding Agents) بناء الألعاب التي نريدها بالفعل؟ الإجابة يمكن أن نجدها في SWE-Game، معيار مبتكر يهدف إلى اختبار قدرات هذه الوكلاء في تطوير الألعاب.
سWE-Game يتضمن 247 مهمة مستندة إلى 41 لعبة مرجعية قابلة للتنفيذ تم تطويرها باستخدام محرك Godot، موزعة عبر 13 فئة من فئات اللعب في بيئات ثنائية وثلاثية الأبعاد. وتغطي هذه المهام خمسة أنواع رئيسية، بدءًا من كتابة ملخص تطوير، إلى التنفيذ من وثائق تصميم الألعاب، وإنجاز الهياكل، وإصلاح الأخطاء في 83 حالة ملحقة، وحتى تحويل الألعاب من Godot إلى Unity.
تساعد المواد المرجعية في تحديد أسلوب اللعب المستهدف، بينما تتيح واجهة التشغيل المشتركة للسائقين والمجسات المملوكة للمقيمين تنفيذ الإجراءات ومتابعة الألعاب التي تم تنفيذها بشكل مستقل. يتم تقييم النتائج من خلال التحقق من حالة المحرك، وإعادة تشغيل البيانات المعتمدة، وعرض ميزات كتبها الوكلاء، مما يساعد على تقييم صحة الآليات، والقدرة على اللعب، واستعادة السلوك بعد الإصلاحات.
تظهر النتائج أن نموذج Opus5 يحقق أعلى درجة إجمالية في جميع المهام الخمسة، ولكن توقعات الأداء تظل دون 60 من 100. وتكشف التحليلات عن وجود مشكلات متكررة في متطلبات التنفيذ وأخطاء منطق اللعب. وعلى الرغم من ذلك، حققت الفحوصات القابلة للتنفيذ دقة متوازنة بنسبة 92.59%، متفوقة على القضاة المعتمدين على الفيديو.
إن SWE-Game يمثل خطوة جديدة نحو فهم القدرات الحالية لوكلاء البرمجة في أنشطة تطوير الألعاب، مما يدعم دمج الأدلة الوظيفية مع التقييم البصري. فهل تعتقد أن الوكلاء قادرون على تقديم تجارب ألعاب مدهشة في المستقبل؟ شاركونا آراءكم!
هل يمكن لوكلاء البرمجة بناء الألعاب المثالية؟ استكشاف SWE-Game الثوري!
تقدم SWE-Game معيارًا فريدًا يتضمن 247 مهمة تتعلق ببناء الألعاب باستخدام منصة Godot. هل يمكن لوكلاء البرمجة تحقيق نتائج متفوقة؟ دعونا نكتشف ذلك!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
