في عالم الذكاء الاصطناعي، يعد التعلم المعزز (Reinforcement Learning) أحد أهم التقنيات المستخدمة لتطوير نظم التعلم الذاتي. ولكن مع ازدياد طول المسارات المأخوذة من السياسات المستخدمة، تصبح مهمة تعيين الائتمان واستكشاف البيئة أكثر تعقيدًا. يحدث هذا التحدي بشكل خاص في الأساليب الساعية لزيادة الانتروبيا، مثل الشبكات الجيلية للتدفق (Generative Flow Networks)، حيث يتعين على الوكيل تعلم كيفية أخذ عينات من توزيع منظم واكتشاف حالات ذات مكافأة عالية تستغرق عدة خطوات للوصول إليها.
لمعالجة هذه المشكلة، نقدم نهجًا جديدًا يتضمن دمج اكتشاف تجريدات الأفعال - أو الأفعال عالية المستوى - في عملية تحسين السياسة. يتضمن هذا النهج استخراج متواليات الأفعال الشائعة الاستخدام عبر مسارات ذات مكافأة عالية وضغظها إلى فعل واحد يتم إضافته إلى فضاء الأفعال.
من خلال التقييم التجريبي في بيئات صناعية وعالمية، أظهرت طريقتنا أداءً محسّنًا من حيث كفاءة العينات في اكتشاف كائنات ذات مكافآت عالية ومتنوعة، خاصة في مشكلات الاستكشاف الأكثر تعقيدًا. والأهم من ذلك، أن الأفعال المجردة من الدرجة العالية كانت قابلة للتفسير، حيث أنها تعكس الهيكل الخفي لمشهد المكافآت في فضاء الأفعال.
يوفر هذا العمل نهجًا مدفوعًا معرفيًا لتجريد الأفعال في التعلم المعزز ويعتبر أول عرض للتخطيط الهرمي في أخذ العينات المتتالية المضبوطة.
فهل نشهد بداية لمرحلة جديدة في التعلم الذاتي؟ شاركونا آراءكم في التعليقات!
ثورة جديدة في التعلم المعزز: كيف تساهم تجريدات الأفعال في تحسين نماذج الاستكشاف؟
تقديم منهج مبتكر لتجريد الأفعال في التعلم المعزز لتحسين كفاءة عينة عالية المكافأة. هذا البحث يسلط الضوء على أهمية التخطيط الهرمي في تحسين تجربة التعلم الذاتي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
