حظي تعلم تعزيز متعدد الوكلاء (Multi-Agent Reinforcement Learning - MARL) باهتمام كبير في الأوساط الأكاديمية، حيث حقق أداءً قوياً في الاختبارات المحاكية. ومع ذلك، يواجه تنفيذ هذه التقنيات في الحياة الواقعية تحديات كبيرة، حيث غالباً ما تنتهك الافتراضات التي تم تصميم وتقييم الخوارزميات بناءً عليها. يمكن أن تتغير أعداد الوكلاء، وتتغير الأهداف، وتصبح المعلومات المركزية غير متاحة، كما قد يظهر سلوك غير متزامن، وتكون السياسات المعتمدة على الشركاء غير مألوفة.

تتناول المراجعات الحالية مجموعة من المتطلبات مثل قابلية التوسع (scalability) والموثوقية (robustness) والعمومية (generalization) وقابلية النقل (transferability)، لكنها تركز عادةً على جوانب مختلفة من التحليل. هنا، نقدم مفهوم adaptability كتصنيف يركز على الفرضيات لتنظيم هذه التغييرات، بدلاً من كونه مطلبًا عالميًا ينبغي أن تنجح فيه كل خوارزمية MARL في كل إعداد.

لقد قمنا بتحديد ثلاثة أبعاد:
1. **قابلية التكيف في التعلم (learning adaptability)**، التي تتعلق بإمكانية تطبيق نماذج التعلم ضمن افتراضات التدريب أو النظام المعدلة؛
2. **قابلية التكيف في السياسات (policy adaptability)**، التي تتعلق بإعادة استخدام أو تعديل السياسات المتعلمة عند حدوث تغييرات في وقت التطبيق؛
3. **قابلية التكيف المعتمدة على السيناريو (scenario-driven adaptability)**، التي تركز على ما إذا كانت معايير الاختبار وبروتوكولات التقييم تكشف عن تغييرات مفيدة وقابلة للتشخيص.

من خلال الفصل بين ما يتغير، ومتى يحدث التغيير، وما نوع التكيف المسموح به، وما يعنيه النجاح، يُوضِّح الإطار كيف تتماشى المفاهيم الراسخة معًا ويشير إلى المناطق التي لا تزال فيها تقييمات MARL غير محددة بشكل كافٍ. في النهاية، يمثل هذا الهيكل أداة قوية لتحسين أداء MARL في العوالم الواقعية.