في مجال التعلم التعزيزي (Reinforcement Learning)، تُعتبر تقديرات القيم المطلقة (absolute state values) أمرًا تقليديًا حيث يُقيّم المقيّمون مدى جودة حالة معينة بشكل مستقل. ومع ذلك، تُظهر الأبحاث الحديثة أن الفروق في القيم وحدها هي ذات الصلة عند السيطرة والتحكم.
استنادًا إلى هذه الرؤية، نُقدم في هذا المقال إطار عمل جديد يُعرف بتعلم القيم النسبية (Relative Value Learning - RV). هذا الإطار يركز على تعلم فروق القيم بشكل مباشر من خلال وظيفة غير متناظرة تُعرف بـ Δ(s_i, s_j) = V(s_i) - V(s_j)، حيث يمثل V القيم المقدرة لكل حالة.
نقدم أيضًا مشغل بيلمان الزوجي (pairwise Bellman operator) ونثبت أنه تعاقد مع γ، مما يعني أنه يمتلك نقطة ثابتة فريدة تعادل الفروق الصحيحة في القيم. نقوم أيضًا بتوليد أهداف محددة جيدًا، سواء كانت هدفًا لخطوة واحدة، أو عدة خطوات، أو حتى أهداف عودة λ، مما يُساهم في إعادة بناء تقدير التفوق العام (generalized advantage estimation) من الفروق الزوجية للحصول على مُقدّر منحدر سياسة غير مُتحيز (R-GAE).
بعيدًا عن النتائج النظرية، نجحنا في دمج تعلم القيم النسبية مع خوارزمية PPO (Proximal Policy Optimization) وحققنا أداءً تنافسيًا على معايير أتا ري (Atari benchmark) التي تشمل 49 لعبة، مما يبرز أن تقدير القيم النسبية هو بديل فعال مقارنة بالمقيّمين التقليديين.
باختصار، تقدم هذه الدراسة ديناميكية جديدة لتقدير القيم في التعلم التعزيزي، مما يُعزز قدرة الأنظمة الذكية على التعلم والتحكم بشكل أكثر كفاءة من ذي قبل. هل أنتم مستعدون لاستكشاف حدود جديدة في عالم الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
تعلم القيم النسبية: تجربة جديدة في تحسين التعلم التعزيزي
تقدم دراسة جديدة إطار عمل مثير يُعرف بتعلم القيم النسبية، الذي يركز على تقدير الفروق في القيم بدلاً من القيم المطلقة. هذه التقنية الحديثة تُظهر نتائج واعدة في تعزيز أداء نماذج التعلم التعزيزي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
