في عالم التعلم الآلي، يعتبر التعلم المعزز الشرطي (Goal-conditioned Reinforcement Learning - GCRL) من الأساليب الواعدة التي تُستخدم لمساعدة الأنظمة على التعلم من التفاعلات مع البيئة المحيطة. يعتمد نجاح هذا النوع من التعلم بشكل كبير على كيفية تمثيل الأهداف المستهدفة للسياسات المستخدمة. بينما تم تطوير أساليب حديثة تقيس الأهداف من خلال المسافة الزمنية (temporal distance) أو إشغال المساحة (occupancy) أو القابلية للتحكم (controllability)، إلا أنه لا يزال من غير الواضح مدى تأثير ذلك على الأداء الفعلي.
قام الباحثون بدراسة هذا من خلال إنشاء تمثيل دقيق للأهداف يعتمد على المسافة الزمنية في المتاهات المحددة (deterministic mazes). وتم خلال هذه الدراسة تحريف الجودة الهندسية لهذا التمثيل مع الحفاظ على المتعلم التابع بشكل ثابت. أظهرت النتائج أن التغييرات الكبيرة في جودة تمثيل الأهداف لم تؤثر تقريبًا على الأداء في المهام البحرية الخاصة بـ OGBench واثنين من الخوارزميات. ومع ذلك، كان لتطبيق نفس التدخلات على الحالة الحالية للعميل تأثير ملحوظ على نجاح الأداء، حيث زادت فرص النجاح بمعدل يتجاوز الضعف.
وعلى ضوء هذه النتائج، أظهر الباحثون أن استخدام ترميز موضعي عشوائي باستخدام التحويلات فورييه (random Fourier positional encodings) يمكن أن يُحسن الأداء بشدة في أقسى المهام البحرية دون الحاجة إلى معلومات خريطة أو تعديلات في الأهداف.
بشكل عام، تُظهر هذه الدراسة أن تحسين كيفية تمثيل الحالة الحالية للعميل هو الأمر الأكثر أهمية في سياق الملاحة في الحالات الثابتة، مما يفتح المجال لمزيد من البحث في كيفية تعزيز التعلم المعزز الشرطي.
تحسين تمثيلات الأهداف: هل يؤدي إلى تعزيز أداء التعلم المعزز الشرطي؟
تناقش الدراسة تأثير تمثيلات الأهداف على أداء التعلم المعزز الشرطي الموجه بالأهداف. النتائج تشير إلى أن تحسين التمثيل الحالي للحالة أكثر أهمية من تحسين تمثيل الأهداف.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
