تعتبر مشكلة توزيع الفضل (Credit Assignment Problem – CAP) واحدة من التحديات الرئيسية التي تواجه تطوير وكلاء التعلم المعزز (Reinforcement Learning – RL) الفعّالين والقابلين للتفسير. في كثير من الأحيان، تفشل النماذج الحالية، سواءً تلك التي تعتمد على التتابع الزمني أو إعادة وزن المكافآت الموجهة إلى الماضي، في تحقيق التوزيع الصحيح بين مهارة الوكيل وعشوائية البيئة.
لذلك، يأتي الإطار الجديد "توزيع الفضل الشابلي المضاد" كحل مبتكر يستند إلى نظرية السببية، حيث يساهم في توزيع الفضل واللوم عبر قيمة شابلي المضادة ($\phi$-value). يهدف هذا الإطار إلى إعادة توزيع المكافآت البيئية بأسلوب يعزز من توزيع الفضل الزمني عبر ثلاثة أبعاد حرجة: السببية النادرة، العشوائية العالية، والمكافآت المتأخرة، دون التأثير على السياسة المثلى.
ومن خلال استنباط تقدير متسق يحسب قيم $\phi$ بفعالية، فإن هذا الإطار يمهد الطريق لفئة جديدة من طرق تدرّج السياسات، المعروفة باسم $\phi$-PPO، جنبًا إلى جنب مع استرجاع المسارات المُعطاة الأولوية (Prioritized Trajectory Replay – PTR).
وتظهر النتائج التجريبية أن قيم $\phi$ تتوافق بدقة مع الأسباب الحقيقية لعائدات المهام، مما يجعلها أكثر كفاءة في استخدام العينات في بيئات تحديّة حيث تفشل الطرق التقليدية السابقة في التوصل إلى نتائج متقاربة.
بفضل هذا التطور، يصبح التعلم المعزز أكثر قدرة على التكيّف مع التحديات المعقدة، مما يمكّن الوكلاء من اتخاذ قرارات أفضل ترتكز على أساس علمي واضح.
إعادة تعريف مشكلة توزيع الفضل: كيف يغير منهج شابلي المضاد مفهوم التعلم المعزز
تقدم الإطار الجديد 'توزيع الفضل الشابلي المضاد' (Counterfactual Shapley Credit Assignment) حلاً فعّالاً لمشكلة توزيع الفضل في وكالات التعلم المعزز، مما يحسن من كفاءة عائدات المهام المعقدة. يعتمد هذا الإطار على نظرية السببية لضمان نسبة الفضل بدقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
