في عالم الدفاع الجوي الحديث، تزايدت التحديات المرتبطة بالتنسيق بين عدة طائرات حربية. هنا يأتي دور التعلم بالمعززات متعدد الوكلاء (Multi-Agent Reinforcement Learning) كمقاربة رئيسية لتحسين اتخاذ القرارات في أنظمة الطيران المستقلة. رغم أن هذه التقنية أثبتت جدواها، إلا أن تحقيق التنسيق التكتيكي المتقدم لا يزال يمثل تحديًا كبيرًا.
تشير الدراسات إلى أن هناك عائقين رئيسيين في هذا المجال. الأول هو عدم وجود نمذجة علاقات هيكلية، مما يعوق قدرة الوكلاء على فهم التفاعلات المعقدة والمتغيرة بمرور الوقت بين مختلف الكيانات على ساحة المعركة. والثاني هو أن المعماريات التقليدية غالبًا ما تفتقر إلى القدرة على نمذجة الأدوار التكتيكية بوضوح، مما يؤدي إلى توزيع غير دقيق للمهام في البيئات الديناميكية.
ولحل هذه التحديات، تم اقتراح إطار جديد يُعرف باسم DRG-MAPPO (Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization). يتميز هذا الإطار بجمعه للنمذجة البيانية للعلاقات مع آلية توزيع الأدوار الديناميكية. يعتمد DRG-MAPPO على إنشاء تمثيل بياني للتفاعلات في ساحة المعركة، مما يسمح باستخدام آليات انتباه بيانية لاستخراج الميزات الهامة بين الحلفاء والأعداء والتهديدات.
يهتم النموذج بتحديد المسؤوليات التكتيكية مثل "القائد" و"الداعم"، ويستند إلى ميزات رسومية مفيدة. بفضل هذا النظام، يحقق DRG-MAPPO أداءً استثنائيًا، حيث سجل نسبة انتصارات تصل إلى 87%، مما يشير إلى فعالية الإطار في تحقيق توازن بين نمذجة العلاقات واستقرار التحسين.
تظهر التجارب أن DRG-MAPPO لا يحقق فقط فوزًا في التحديات الجوية، بل يمكن أيضًا أن يلهم العديد من التطبيقات في مجالات آخرى تتطلب التنسيق بين عدة عوامل.
DRG-MAPPO: إطار جديد ثوري في التعلم بالمعززات متعدد الوكلاء للقتال الجوي التعاوني
أحدث DRG-MAPPO نقلة نوعية في أساليب التعلم بالمعززات متعددة الوكلاء، حيث يقدم نموذجًا مبتكرًا لتحسين التنسيق التكتيكي خلال القتال الجوي. بتقنيات جديدة مثل النمذجة البيانية، يحقق هذا الإطار نسبة انتصارات تصل إلى 87%!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
