يعتمد التعلم المعزز (Reinforcement Learning) بشكل متزايد في حل المشكلات المالية التي تتطلب تحكمًا أمثل، خاصة عندما تجعل الديناميكيات المعقدة من الصعب الحصول على استراتيجيات تحليلية. في دراسة جديدة، تم اختبار نموذج تحسين السياسات القريب (Proximal Policy Optimization - PPO) في لعبة تجارية تم حلها تحليلاً، حيث يعمل الوكيل كوسيط يتفاعل مع متداول مطلع وتدفق أوامر غير مطلعة عشوائي.

يهدف هذا البحث إلى تقييم ما إذا كان التعلم المعزز يمكنه الاستفادة من النماذج التحليلية المتاحة. تم اشتقاق مكافأة خطوة نهائية من مدفوعات الوسيط المستمرة في الزمن، وتم التحقق من تنفيذها المنفصل من خلال تحسين الشبكة. عند غياب التدفق غير المطلع، يقترب نموذج PPO المدعوم بشبكة عصبية من العمل المرجعي. ومع ذلك، عندما يوجد تدفق غير مطلع عشوائي، تظهر النماذج الحقيقية مثل PPO - FFNN و PPO - LSTM عدم دقة في التقديرات، رغم أن التعلم المراقب أكد قدرة العوامل على تمثيل العمل.

تظهر تحليلات مونت كارلو أن النقاد في هذه النماذج لا يصنفون الأعمال القريبة بشكل موثوق. حتى مع المعلومات الجزئية، يبقى المتحكم المعتمد على التاريخ القابل للرصد قريبًا من الإحالة، بينما تعاني نماذج PPO من أخطاء أكبر وعوائد أقل. في مرحلة متقدمة من البحث، تم تجميد السياسة التحليلية وتدريب PPO على تعديلها بعد تغيير تكلفة التنفيذ، مما ساعد في تحقيق تحسين قابل للتكرار بنسبة 2.22%.

تظهر هذه النتائج أن الحلول التحليلية ليست فحسب معيارًا لتشخيص التعلم المعزز بل تعتبر أيضًا سياسة انطلاق مفيدة للتكيف مع المتغيرات المالية.