في عالم التعلم المعزز (Reinforcement Learning) المتقدم، تعتبر المهارات دعائم أساسية للتقدم. قدم باحثون حديثًا نظام تدريب جديد يُعرف باسم PATS، الذي يقلب وجهات النظر التقليدية حول كيفية استغلال هذه المهارات.
العديد من وكلاء التعلم المعزز يواجهون تحديات كبيرة خلال فترات التدريب الطويلة، حيث تميل السياسات الضعيفة إلى تكرار نفس الأخطاء وتوليد مسارات غير مفيدة. بينما تسعى الأساليب الحالية التي تركز على المهارات إلى تحسين الاستكشاف من خلال تحسين أو تصفية المهارات القابلة للاستخدام، فإنها غالبًا ما تركز على المهارات نفسها بدلاً من توفير دعم تدريبي مرن.
لذا، جاء الابتكار في PATS مع نموذج تدريب يركز على السياسات، حيث يُعاد تصور المهارات كدعائم تدريب ديناميكية. من خلال تحويل مجموعات العروض إلى بطاقات إثبات واستخدام تقييمات محددة لكل مهمة، يمكن تحسين السياق المطبق في العروض اللاحقة.
هذا النموذج يوفر توجيهات ملموسة تساعد السياسات الضعيفة في إتمام المهام الصعبة. ومع تحسين السياسة، يتم تعديل أو إزالة السياقات المتكررة لتقليل الاعتماد على التوجيهات الصريحة، مما يضمن التنوع المفيد.
على صعيد الأداء، أظهرت التجارب على منصات مثل ALFWorld و WebShop أن PATS تمكن من تحقيق تحسينات تصل إلى 18.6% مقارنة بالنماذج الأساسية القوية، كما تبقى منافسـًا قويًا في سبعة قياسات نوعية، مع استخدام 32.1% أقل من رموز الطلب مقارنة بالأساس.
الإطلاق الرائع: PATS تقدم تدريبًا ذكيًا لوكالات التعلم المعزز
تقدم PATS ثورة في طريقة تدريب الوكلاء في التعلم المعزز من خلال إعادة تصور المهارات كدعائم تدريب ديناميكية. النظام الجديد يعد بتحسين فعالية الأداء واستكشاف المهارات بتقليص الاعتماد على التوجيهات المحددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
