في عالم الذكاء الاصطناعي، يمثل التعلم المعزز (Reinforcement Learning) أحد أبرز مجالات البحث، حيث تسعى الخوارزميات إلى تطوير سياسات تتفاعل بفعالية مع البيئة المحيطة. ومن ذلك، تبرز خوارزميات التعلم من دون مكافآت كأداة مبتكرة تهدف إلى التعلم من مجموعة بيانات خالية من المكافآت واسترجاع السياسات المثلى وفق أي دالة مكافآت في وقت التجربة.

ومع ذلك، يبقى التحدي قائمًا حول كيفية جمع مجموعة بيانات متنوعة وملائمة دون معرفة مسبقة بالمهام المستقبلية التي سنواجهها. في دراستنا الجديدة، نركز على تطبيق التعلم المعزز من دون مكافآت للتحكم في الروبوتات الرباعية (Quadrupedal Control) باستخدام أنظمة حقيقية، معتمدين على خوارزمية "Forward-Backward".

تظهر النتائج أن الاستكشاف غير الموجه يؤدي إلى جمع بيانات ذات تنوع منخفض، مما يقود إلى أداء ضعيف للسياسات المسترجعة وعدم جدواها في التنفيذ المباشر على الأجهزة. لذلك، نقدم خوارزمية جديدة تدعى (FB-MEBE) تجمع بين استراتيجية استكشاف سلوكيات غير مشروطة مع ناقد للتنظيم.

تسهم FB-MEBE في تعزيز الاستكشاف من خلال تعزيز انطلاقة توزيع السلوكيات المكتسبة، مع توجيه السياسات المسترجعة نحو سلوكيات طبيعية وواقعية. من خلال التجارب، أثبتت FB-MEBE أداءً محسنًا مقارنةً باستراتيجيات الاستكشاف الأخرى في مجموعة من المهام المحاكية. كما أن السياسات الطبيعية التي تنتجها يمكن نشرها بسلاسة على الأجهزة دون الحاجة إلى مزيد من التخصيص. لمزيد من التفاصيل، يمكنكم زيارة موقعنا حيث تجدون الفيديوهات والكود المصدري لهذا البحث.