في دراسة جديدة طُرحت على موقع arXiv، تمتد نتائج سابقة تتعلق بالنتائج التنافسية المتجاوزة (supra-competitive outcomes) في ألعاب التنفيذ الأمثل (optimal-execution games)، من خلال تسليط الضوء على آلية تعلم عقابية (punitive mechanism) يمنع deviations ويظهر الأدلة السلوكية على التعاون (collusion).

تتناول الدراسة تنفيذ عملية التحليل في لعبة تصفية معينة تُعرف باسم Almgren-Chriss liquidation game، والتي تُلعب بين لاعبين في أفق زمني محدود. حيث استخدم الباحثون وكلاء مستقلين يعتمدون على تحسين السياسة القريبة (proximal policy optimization) مع إمكانية الوصول إلى سجلات الأسعار والإجراءات داخل الحلقة، مما أتاح لهم تحقيق تكاليف تقل عن المعايير المعروفة، مثل معيار ناش (Nash benchmark).

خلال التجارب، تم تحديد انحراف مربح عبر التدريب ضد الجدول الزمني المتوسط للتصفية المُتعلم، وتم فرض أول تجارة على أحد الوكلاء الأصليين. في المقابل، قام الخصم بتسريع عملية التصفية، مما تسبب في تفوق رد فعله على مكسب المنحرف في جميع الحالات، مع الحفاظ على متوسط مكاسب المُعاقب بشكل ملحوظ دون تغيير.

ويظهر البحث أيضًا أن العقاب الذي يفرضه المُعاقب يحلّ بشكل أكبر التكاليف على المنحرف بينما يُحافظ على متوسط دخله. وتزداد حالات المطابقة بين الانحرافات وفترات البيع الإضافية خلال التدريب، مع الاحتفاظ بسياسات نهائية تستجيب بطريقة فعّالة وعقابية.

بهذا الشكل، تُظهر النتائج أدلة سلوكية واقتصادية تدعم تفسيرًا تعاونيًا للنتائج التنافسية المتجاوزة، مما يوفر وجهة نظر جديدة حول كيفية تأثير العقوبات على سلوك السوق. ما هي الانعكاسات المحتملة لهذه الاكتشافات على الأنظمة المالية المعاصرة؟ شاركونا آراءكم في التعليقات!