في دراسة جديدة على منصة arXiv، تم تسليط الضوء على AlphaZero، النموذج الشهير الذي يجمع بين شبكة السياسة-القيمة (policy-value network) وتقنية البحث بواسطة الشجرة (Monte Carlo tree search). لكن السؤال الحقيقي هنا هو: عندما يتعرض نظام البحث الذاتي لمؤشرات تكتيكية مفيدة، هل يتم امتصاص هذا السلوك من قبل الشبكة، أم أن الشبكة تعتمد على هذه السلوكيات فقط خلال وقت البحث؟

للإجابة على هذا السؤال، استخدم الباحثون استراتيجية تسمى "تدخل مؤشرات المرحلة المتقاطعة (Cross-Phase Prior Intervention)"، التي تستبدل المؤشرات التكتيكية بشكل مستقل خلال فترة التدريب وعند التقييم، مما يسمح بتفريق تأثير المؤشر على الأداء الفعلي وما تتركه هذه المؤشرات من أثر في أوزان النموذج.

هدف الدراسة كان ضيقًا، حيث تم تقييم مدى تكرار قيام الشبكة بأداء مهام دفاعية قسرية بدون توجيه خلال وقت البحث. في تجارب مختصرة في ألعاب Gomoku وGo، أظهر التجربة أن حذف المؤشرات أدى إلى استجابة متبقية كبيرة، حيث زادت النسبة من 13.8% إلى 26.3% في Gomoku ومن 0.6% إلى 33.8% في Go. كما أن إعادة تمكين المؤشر أعادت تقريباً الاستجابة الكاملة، مما يدل على وجود فجوات اعتماد كبيرة.

تعكس هذه النتائج أهمية البحث الذاتي كمنهاج تعليمي في التدريب، حيث أن الدروس المستفادة تُعتبر حقيقية وجزئية ومرتبطة بالهندسة، مما يميز بين الكفاءة أثناء التنفيذ والكفاءة الداخلية. هل تتوقع أن توفر هذه النتائج نظرة جديدة على كيفية تعليم الذكاء الاصطناعي من خلال الاستراتيجيات والتكتيكات؟ نود سماع آرائكم وتجاربكم في التعليقات!