في عالم الذكاء الاصطناعي، يعد التعلم المعزز (Reinforcement Learning) أحد الفروع الأكثر بروزًا، حيث يتم تصنيفه تقليديًا إلى طريقتين: تلك القائمة على النماذج (Model-based) وتلك غير القائمة على النماذج (Model-free). بينما تعتمد الطريقة الأولى على التخطيط المسبق باستخدام نموذج تعلمت فيه البيئة، تسعى الطريقة الثانية إلى تعلم سلوك تفاعلي عبر تقييم المكافآت.

ومع ذلك، أظهرت الدراسات الحديثة أن التخطيط يمكن أن يظهر من التعلم المعزز غير القائم على النماذج في حد ذاته. لكن، يبقى السؤال: ما هي الظروف التي تجعل هذا السلوك الناشئ ممكناً؟ في ورقتنا البحثية، نقدم أدلة على أن الهيكل الخفي للدولة (Hidden-state structure) في معمارية الشبكة يعد العامل الحاسم.

اكتشفنا أن شبكات من حالات خفية علاقاتية ترتبط بكل حالة بيئية وتبادل الرسائل على طول العلاقات المتعلمة، يمكن أن تتبنى آلية للتخطيط. هذه الحالات الخفية تستعيد هيكل الانتقالات في البيئة من خلال العلاقات التي تعلمتها، مما يحسن من سياسة اتخاذ القرار عند الحاجة. في مقارنة مع وكيل تحكم مدروس يجب عليه اكتشاف أي الخلايا تمثل أي الحالات، لم يظهر أي تواصل وهذا يمنع ظهور التخطيط.

تساهم هذه النتائج في تفسير الظاهرة المرصودة عن التخطيط الناشئ في التعلم المعزز غير القائم على النماذج، وتطرح تساؤلات جديدة حول مدى شيوع التخطيط الناشئ بشكل عام. إضافةً إلى ذلك، نفترض أن الآلية المكتشفة قد تفسر كيف يظهر التخطيط من خلال أقصى مكافأة في الدماغ البشري عن طريق هندسة عصبية سابقة.

في ختام هذا التحليل، لا يسعني إلا أن أتساءل: كيف يمكن لهذه النتائج أن تعيد تشكيل فهمنا لآليات الذكاء الاصطناعي ودورها في اتخاذ القرار؟