في دراسة مبتكرة نُشرت على منصة arXiv، قام الباحثون بتنفيذ نظام شطرنج يعتمد على تقنية AlphaZero تحت ظروف تدريب محدودة. الهدف من البحث هو استكشاف مدى قوة النظام في ظل قيود الحوسبة، وتحديدًا عند تهيئته بطريقة فعالة.

اعتمدت الدراسة على نموذج يتكون من 6.32 مليون معلمة، حيث تم تدريبه من الصفر – من حالة عشوائية عبر لعب ذاتي مع بحث موسع. استُخدم في التجربة عقدة تتكون من ثمانية وحدات معالجة رسومات (GPUs) عملت لمدة 2.5 يوم. ونتيجة هذا الجهد، تمكن النظام من تحقيق مستوى 3,251 على مقياس Elo، بعد حوالي 100,000 عملية بحث لكل حركة خلال أقل من خمس ثوانٍ.

هذا الأداء الرائع نتج عن معالجة 3.25 مليون لعبة تم الانتهاء منها، وفي خضم ذلك، تم إنجاز نحو 100 مليار عملية محاكاة بحثية و836.6 مليون عرض تدريب. استعرض الباحثون أيضًا كيف تم تخصيص عمليات البحث، واختيار إعادة التشغيل، وتمثيل السياسات، وتطوير النموذج بشكل تدريجي، وتقنيات الاستدلال الكمي.

من المؤكد أن النتائج التي تم الوصول إليها هي نتاج النظام المتكامل، وليس مجرد فوز فردي ناتج عن اختيار واحد فقط. كما تم توثيق بدائل ممكنة لم تنجح في تحسين حلقة التعلم الشاملة أو لم تكن مبررة من حيث التكلفة.

هذه الدراسة تترك لنا تساؤلاً مثيرًا: كيف يمكن استخدام الذكاء الاصطناعي في مجالات أخرى لتحقيق إنجازات مماثلة؟