في عالم الذكاء الاصطناعي، تتطلب أنظمة التعلم المعزز المتعددة الوكلاء (Multi-Agent Reinforcement Learning - MARL) تنسيقًا فعالًا بين الوكلاء لتحقيق الأهداف بشكل جماعي. ومع تزايد عدد الوكلاء، تصبح الحاجة إلى طرق تواصل موثوقة وغير محدودة أمرًا ضروريًا.

اليوم، نُقدّم لكم نموذجًا رائدًا يُعرف بـ Shared Recurrent Memory Transformer (SRMT). هذا النموذج يحدث ثورة في كيفية تواصل الوكلاء مع بعضهم البعض، حيث يتيح لهم تبادل المعلومات حول سلوكهم ونواياهم بشكل غير مقيد، بعيدًا عن القيود التقليدية التي تفرضها البروتوكولات الاتصالية أو التدريب المركزي.

يعتمد SRMT على مبدأ ذاكرة العمل المشتركة، حيث يتمكن الوكلاء من بث حالات ذاكرتهم المتعلمة واستفسار الآخرين عن معلوماتهم. هذه الطريقة لا تساهم فقط في عملية التخطيط، بل تُحسن التنسيق بين الوكلاء حتى في غياب إشارات المكافأة.

تم اختبار SRMT في مشكلة التخطيط المسار (Partially Observable Multi-Agent Pathfinding - PO-MAPF)، حيث يبقى التنسيق أمرًا حيويًا لتفادي التعطيل وتحقيق التخطيط الأمثل. وأظهرت نتائج الاختبارات أن SRMT يتفوق على الطرق القائمة على التواصل والذاكرات المعززة، وخاصة في الحالات التي تعاني من ندرة الإشارات التحفيزية.

أحد الخصائص البارزة لنموذج SRMT هو قدرته على التوسع مع تزايد عدد الوكلاء وحجم الخرائط، مما يوفر أداءً تنافسيًا مع أحدث نماذج MARL وطرق التخطيط دون الحاجة لأي استراتيجيات خاصة.

إذا أردت معرفة المزيد، يمكنك الوصول إلى كود المصدر الخاص بالتدريب والتقييم على GitHub [https://github.com/Aloriosa/srmt].

هل تعتقد أن SRMT يمكن أن يكون له تأثير كبير على مجالات أخرى خارج الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!