أتت الدراسات الحديثة في مجال الذكاء الاصطناعي بخبر مثير حول استخدام التعلم العميق (Deep Reinforcement Learning) في لعبة باغشال، وهي لعبة كلاسيكية تقليدية تعود أصولها إلى نيبال. تضم اللعبة لاعبين، أحدهما يتحكم بأربعة نمور، بينما الآخر يسيطر على عشرين حرباء. الهدف هنا هو استخدام الاستراتيجيات الذكية لاحتجاز الأعداء!

قد لا تكون باغشال مشهورة إلى حد كبير في الأدبيات العلمية، لكن الورقة البحثية الجديدة تبرز الطرق الأربع التي تم اختبارها باستخدام التعلم العميق، وهي: شبكة Q العميقة (Deep Q-Network, DQNخوارزمية REINFORCE، تحسين السياسة القريبة (Proximal Policy Optimization, PPO)، وMuZero. تم تدريب النماذج على جانب من جوانب اللعبة asymmetry، ثم تم تقييم كفاءتها على الجانب الآخر.

أظهرت النتائج المثيرة أن خوارزمية MuZero حققت معدل فوز يصل إلى 86% ضد النمور و62% ضد الحرباء، ما يجعلها الخيار الأفضل من حيث الأداء. تعود هذه القدرة إلى استخدام التخطيط القائم على النموذج (model-based planning) والتقنيات الإحصائية المتقدمة مثل بحث شجرة مونت كارلو (Monte Carlo Tree Search).

بالرغم من أداء MuZero المتفوق، فقد أظهرت خوارزمية PPO كونها الخيار الأكثر واقعية، حيث كانت قادرة على المنافسة بفاعلية في كلا الجانبين بتكاليف حسابية أقل بكثير.

أخيرًا، التحليل الاستراتيجي أظهر أن الاستراتيجيات المعتمدة على النموذج هي الأنسب للتخطيط على المدى الطويل، في حين أن الخيارات القائمة على القيمة مثل DQN تميل إلى التفوق في دور النمور نظرًا للإشارات القوية للمكافآت.