في عالم الذكاء الاصطناعي، التواصل بين الوكلاء في بيئات التعلم بالتعزيز متعدد الوكلاء (Multi-Agent Reinforcement Learning) يعد أمرًا حيويًا لتحقيق الأهداف المشتركة. ومع ذلك، السؤال الأهم هو: متى يجب على الوكلاء التواصل؟
تقدم الدراسات الحالية طرقًا مختلفة، ولكن العديد منها يعتمد على التواصل المستمر أو على آلية مزدوجة تُعلَّم عبر انحدار سياسة REINFORCE، والتي تُظهر سلوكًا غير مستقر في بعض الأحيان. لكن الباحث يقدم بديلًا قائمًا على مبادئ جديدة، حيث يُقترح أن يكون التواصل مبنيًا على قياس انحراف KL (KL Divergence) بين توزيعات المعتقدات الخاصة بالوكلاء، بحيث يتم التواصل فقط عندما يتجاوز انحراف KL عتبة محددة مسبقًا.
يقوم كل وكيل بالحفاظ على توزيع اعتقادي حول حالة العالم الخفية، يتم حسابه كمتوسط باستخدام دالة softmax على الحالة المخفية لشبكة LSTM (LSTM Hidden State). فقط عندما يكون هناك اختلاف كبير في المعتقدات، تُبادر الوكلاء بالتواصل.
أظهرت التجارب التي أجريت على معيار Predator-Prey وMPE simple_spread نتائج مثيرة للاهتمام. حيث أثبتت أن استخدام انحراف KL يوفر توازنًا مثاليًا بين التعاون والمنافسة. ومن المفاجئ أن بعض التجارب أظهرت أن الوكلاء حققوا زيادة في المكافأة ومتوسط الأداء بنسبة 12 نقطة، مع تقليل التباين بشكل كبير.
هذه البحثية تفتح أفكارًا جديدة حول كيفية فهم وتحسين الاتصالات بين الوكلاء في الأنظمة المعقدة، مما يُسهم في تعزيز التعاون والحصول على نتائج أفضل. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
متى نتواصل؟ تحقيق الاتصالات الفعّالة في التعلم بالتعزيز متعدد الوكلاء
يستعرض البحث كيفية تحسين التواصل بين الوكلاء في التعلم بالتعزيز باستخدام طريقة جديدة تعتمد على انحراف KL، والتي تعزز من فعالية نقل المعلومات. نتائج التجارب تظهر زيادة ملحوظة في الأداء مقارنةً بالأساليب الحالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
