في عالم ألعاب الذكاء الاصطناعي، كانت الخوارزميات تعتمد بشكل كبير على البحث المعقد وتحسين الوظائف لتحقيق نتائج فعالة. لكن دراسة جديدة تبحث في فعالية تقنية تقدير القيمة التقريبية (Approximate Value Iteration - AVI) قد تكشف عن مفاجآت جديدة.

تعتبر خوارزمية البحث عبر شجرة مونت كارلو (Monte Carlo Tree Search - MCTS) من أكثر الطرق شيوعاً في تطوير برامج اللعب الذاتي، ولكن التكاليف الحسابية المرتبطة بها تتطلب موارد ضخمة. في هذه الدراسة، قام الباحثون بتدريب تنفيذ بسيط للعب الذاتي باستخدام تقنية AVI، وقاموا بتقييم أدائه بالمقارنة مع أساليب تقليدية أخرى.

وقد أظهرت التجارب أن AVI تتمتع بفعالية أكبر في تعلم الوظائف القيمة مقارنة بـ AlphaZero، حيث تتجاوز دقتها توقعات الباحثين. بالإضافة إلى ذلك، تبين أن السياسات القاسية التي تعتمد على خطوة واحدة لها أداء تنافسي مقابل السياسات المعتمدة على MCTS، ولكن بتكاليف تدريب واستدلال أقل بشكل ملحوظ.

كما تم إجراء تجارب أولية على ألعاب مثل Othello وGo(9x9)، حيث أوضحت النتائج أن تقنية AVI تتعلم بشكل مستقر في الألعاب الأكبر وتحقق وظائف قيمة فعالة.

هذه النتائج تشير إلى أن تقنيات MCTS قد طغت على الطرق الأبسط، التي أصبحت الآن أكثر عملية بفضل أدوات التعلم العميق الحديثة. لذا قد يكون الوقت قد حان لإعادة تقييم فعالية الأساليب التقليدية في عالم ألعاب الذكاء الاصطناعي.