في دراسة جديدة تتناول مجال التعلم المعزز (Reinforcement Learning)، تم اكتشاف مشكلة خطيرة في نموذج Proximal Policy Optimization (PPO) تدعى 'تساوي القيم' (Value Flattening). أثناء عملية تعلم النموذج، يستخدم PPO الناقد لتقدير قيم الحالات وتقليل تباين تحديثات السياسات. ومع ذلك، تبين أن الناقد يعاني من فشل منهجي يتمثل في تساوي القيم، حيث تتغير تقديرات القيم بشكل حاد عبر الحالات الوسيطة بينما تبقى توقعات الناقد مسطحة نسبيًا. تم اختبار هذه الظاهرة في بيئة FrozenLake تحت السيطرة، واتضح أنها تزداد وضوحًا مع نمو مساحة الحالة.
توضح التحليلات النظرية والتجريبية كيف يرتبط تساوي القيم بعقوبة التباين الضمنية في خسارة الناقد والتحديثات الزائدة الناتجة عن الحالات الزمنية المرتبطة ذات التدرجات المماثلة. استنادًا إلى هذه النتائج، تم تقديم تقنية جديدة تُدعى SParse Proximal Policy Optimization (SP$^3$O)، حيث تُطبق خسارة القيمة على عدد قليل من الحالات المنفصلة جيدًا في كل استجابة للحد من كلا التأثيرين.
أظهرت التجارب التي أجريت على نموذج Qwen3-Base أن SP$^3$O، عندما يراقب ثلاث حالات فقط لكل استجابة، يمكنه الحد من ظاهرة تساوي القيم وتحسين السياسة المكتسبة بشكل مستمر عبر أحجام النماذج ومجموعات التقييم. وبشكل عام، تبرز نتائج هذه الدراسة أهمية ظاهرة تساوي القيم كأحد الأوضاع الفاشلة التي تم تجاهلها في تعلم الناقد ضمن نماذج PPO القياسية، كما كشفت أن استراتيجية الإشراف النادرة البسيطة يمكن أن تقلل من حدتها.
إعادة التفكير في تعلم النقاد في PPO: كيفية فهم وتقليل ظاهرة تساوي القيم
تسليط الضوء على مشكلة 'تساوي القيم' التي تواجه نموذج Proximal Policy Optimization (PPO) وكيف يمكن التغلب عليها من خلال تقنية جديدة. النتائج تظهر أهمية الابتكار في تحسين التعلم في الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
