في عالم الذكاء الاصطناعي والتعلم الآلي، يتطلب تحديث النماذج الهيكلية العالية الأبعاد خوارزميات قادرة على التنقل بشكل فعال في مشهد معقد وغير محدب مع وجود معلمات مرتبطة. وتتنافس الخوارزميات الحالية في هذا المجال، ولكن الكثير منها تعتمد على هياكل ثابتة أو قواعد تبديل محددة مسبقًا، مما يؤدي إلى فترات بحث غير متصلة.

لذا، توصلت دراسة حديثة إلى خوارزمية جديدة تُعرف باسم خوارزمية التحكم الديناميكي باستخدام التعلم المعزز العميق (DRL-DCO)، حيث يتم الاعتماد على وكيل يعتمد على أسلوب التعلم القائم على الممثل والنقد (DDPG) لإدارة عملية التطور كمنظومة موحدة بدلًا من مجموعة من الخوارزميات المتصلة بشكل ميكانيكي.

تعمل الخوارزمية من خلال تمثيل حالة واعٍ بالتقدم ومكافأة معتمدة على تنوع الحلول، مما يسمح للوكيل بإعادة تخصيص الموارد الحاسوبية بين استكشاف الاختلاف (DE) واستغلال اقتران التحريف (CMA-ES) بشكل فعال، كما ينظم أيضًا حجم السكان وحفظ النخبة وآلية إعادة التشغيل لتجنب التحسينات المحلية
.

بعد مرحلة التدريب، يمكن للوكيل المدرب العمل في وضع تخمين غير مراقب، حيث يقوم بالتحكم في كل من DE وCMA-ES من خلال تنفيذ تقديرات مستمدة فقط من الحالات الملاحظة، وهذا يعزز السرعة في التطبيق مع الحفاظ على الكفاءة الكاملة.

تثبت هذه الخوارزمية جدواها من خلال تقييمها على معايير تحسين ذات هدف أحادي عالية الأبعاد ومنصة مراقبة الصحة الهيكلية (IASC-ASCE)، حيث حققت DRL-DCO دقة تفوق الخوارزميات التكيفية والهجينة الرائدة الحالية، بالإضافة إلى نماذج DRL التي تعتمد على مشغل واحد.