في عالم الذكاء الاصطناعي، تعتبر خوارزميات التعلم المعزز (Reinforcement Learning) محط اهتمام كبير، وخاصة في سياق العمل متعدد الوكلاء (Multi-Agent Systems). كانت الأساليب السابقة، مثل خوارزميات الممثل-الناقد (Actor-Critic)، تُطبق بشكل أساسي في بيئات فردية، لكن العمل الأخير يفتح آفاقاً جديدة في فهم كيفية أداء هذه الخوارزميات في خيارات العمل المتعددة.

تستعرض هذه الدراسة خوارزميات مثل خوارزمية "الممثل-الناقد الطماع" (Greedy Actor-Critic، GAC) و"الممثل-الناقد اللين" (Soft Actor-Critic، SAC) و"الناقد الكوانتي المقيد" (Truncated Quantile Critics، TQC). تركز الدراسة على كيفية توسيع هذه الأساليب لتشمل إعدادات متعددة الوكلاء دون الاعتماد على شراكة التدريب المركزية التقليدية، حيث تستخدم أربع وكالات مستقلة تشارك الذاكرة مع الحفاظ على شبكات سياسة وقيمة منفصلة.

تقييم الأداء يتم من خلال تكرار عشرة تجارب، حيث تم استخدام معايير مثل العائد المتوسط من التقييم ووقت التدريب لمقارنة الأداء بين الوكلاء الفرديين ومتعدد الوكلاء في مهام مثل Platform-v0 وGoal-v0. تكشف النتائج أن الإطار المتعدد الوكلاء يعزز أداء خوارزمية GAC، بينما أظهرت MASAC وMATQC تحسينات متواضعة على نسخها الفردية.

ومع زيادة عدد الوكلاء، كان هناك تحسين محدود في الأداء مع تفشي تكاليف الحوسبة بشكل ملحوظ، مما يبرز الحاجة إلى التوازن بين أداء التعلم وكفاءة الحوسبة. تصبح هذه النتائج دليلاً على أهمية تطوير الأساليب متعددة الوكلاء في التعلم المعزز المدعوم بين أيدي الباحثين لتوسيع التطبيقات المستقبلية.