تُعدّ عملية تعلم الاستراتيجيات في البيئات التنافسية المتعددة الوكلاء (Multi-Agent Environments) بمثابة تحدٍ حقيقي، حيث يتحدد مكافأة كل وكيل بناءً على الاستراتيجية المشتركة. وبالرغم من اعتماد بعض الوكلاء على استراتيجيات تعلم جشعة تهدف إلى زيادة مكافآتهم الذاتية، إلا أن هذه الاستراتيجيات قد تجد نفسها عالقة في تحسين محلي، مما يحد من فعاليتها.

في السنوات الأخيرة، تم اقتراح طرق لنمذجة الخصم وتشكيله، حيث تسهم هذه الأساليب في تحسين فعالية تعلم الاستراتيجيات عبر نمذجة الاستراتيجيات وعمليات التحديث الخاصة بالوكلاء الآخرين. ولكن، تواجه هذه الأساليب قيوداً واضحة، حيث تعتمد بشكل كبير على توقعات بسيطة لتغير استراتيجيات الخصم، مما يجعلها قابلة للتطبيق فقط في سيناريوهات محددة مسبقًا ولا تمتلك قدرة على التعميم.

لحل هذه المشكلة، نقدم في ورقتنا طريقة جديدة تسمى تشكيل الخصم القائم على التفضيلات (Preference-based Opponent Shaping - PBOS). يهدف هذا الأسلوب إلى تعزيز عملية تعلم الاستراتيجيات من خلال تشكيل تفضيلات الوكلاء نحو التعاون. نقدم هنا معلمة تفضيل، تُدمج ضمن دالة خسارة الوكيل، مما يسمح له بالتفكير مباشرةً في دالة خسارة الخصم عند تحديث استراتيجيته.

بفضل تحديث معلمات التفضيل بالتزامن مع تعلم الاستراتيجية، تتمكن الوكلاء من التكيف مع أي بيئة لعب تعاونية أو تنافسية. تجاربنا أثبتت فعالية خوارزمية PBOS في مجموعة متنوعة من الألعاب القابلة للتفريق، حيث تمكّنت من إرشاد الوكيل لتعلم معلمات التفضيل الأكثر ملاءمة، مما أدى إلى تحقيق توزيع مكافآت أفضل في بيئات متنوعة.