في عالم التحكم المستمر، تعتبر أساليب الممثل-الناقد (Actor-Critic) من بين الأكثر أداءً، إلا أن السياسات المفروضة قد تؤدي أحيانًا إلى تصرفات متقلبة بشكل مفرط. وللتغلب على هذه المشكلة الشائعة، يتم عادةً إضافة خسائر إضافية لتعزيز السلاسة. ومع ذلك، قد يكون تأثير هذه الخسائر غير ملحوظ عندما تكون تدرجاتها صغيرة مقارنةً بتدرج الممثل الأصلي. كما أن الأساليب الموجودة غالبًا ما تجمع بين عدة خسائر إضافية، مما يزيد من تعقيد موازنة الخسائر دون تحسين فعلي في ضبط العائد والسلاسة.
نقدم لكم دامتبر (DAMPER)، وهي تقنية مبتكرة تجمع بين التدرج الأصلي للممثل وتدرج الاتساق الزمني من خلال إسقاط مشروط على النزاعات والسيطرة على الحجم بشكل تكيفي. تزيل هذه التقنية العنصر الإضافي الذي يتعارض مع تدرج الممثل وتقوم بتعديل الاتجاه الزمني المحتفظ به بما يتناسب مع معيار تدرج الممثل الأصلي، مما يحافظ على الارتباط الإيجابي مع هذا التدرج.
أظهرت التجارب مع نموذج TD3 وSAC على ستة مهام للتحكم المستمر تقليلًا في تقلب الأفعال بالمقارنة مع الوكلاء الأصليين عبر 12 زوجًا من المهام المختلفة، مع تحقيق أفضل نقاط تقلب بين الأساليب المقارنة في ثمانية مهام، مع تجارب تقوم على التبادل العائدي.
إذا كنت مهتمًا بتطورات الذكاء الاصطناعي وكيفية تحسين أداء الأنظمة المتقدمة، فإن دامتبر تقدم لك رؤية جديدة ومثيرة للاهتمام.
دامبر: التحكّم في التدرجات مع أولوية العائد لسياسات سلسة
تقدّم دامتبر (DAMPER) حلاً مبتكرًا لمشكلة التقلبات العالية في السياسات في التحكم المستمر، حيث يوازن بين العائد وسلاسة التحكم بشكل فعّال. من خلال دمج التدرجات المكانية مع السيطرة على التنازع، تحقق تقنية دامتبر نتائج مبهرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
