في خطوة جديدة نحو تحسين تعلم الآلات، قدم الباحثون دراسة مبتكرة تؤكد أن التعلم المعزز مع المكافآت القابلة للتحقق (RLVR) يوفر نهجًا قابلًا للتوسع لتدريب الوكلاء الذكيين، رغم أن المكافآت القليلة في البداية يمكن أن تؤدي إلى إشارات ضئيلة لتحسين السياسات. في هذا السياق، اكتشف الباحثون ظاهرة تُعرف بتسريع السياسة، حيث حقق RLVR المُعدّل باستخدام التقنيات الحديثة (on-policy distillation) أداءً عاليًا بشكل أسرع خلال فترة التدريب، مع تحقيق أداء متوسط أعلى خلال الأوقات اللاحقة مقارنة بالمعايير البديلة.
من خلال تحليل هذه الظاهرة، فقد عرف الباحثون مفهوم "التدفئة الموجهة" (On-Policy Warmup)؛ وهي مرحلة يتم فيها توجيه الطالب من قبل المعلم أثناء تدريبه على مسارات تفاعلاته الخاصة، قبل الانتقال إلى المرحلة الرئيسية من التعلم المعزز. وبخلاف تقنيات التقليدية، تقوم هذه الاستراتيجية بتوجيه الطلاب نحو الحالات الناتجة عن قراراتهم الخاصة، بما في ذلك القرارات غير المثالية ومواقف التعافي.
تصل الأبحاث إلى أبعاد نظرية مثيرة من خلال ربط أساليب التداخل العكسي (reverse-KL distillation) بجعل التوزيع على مستوى المسار. وتُظهر النتائج أن وجود معلم كفء مع تقليل الخسارة خلال عملية التكرار، يؤدي إلى تحسين ملحوظ في النجاح الأولي والمكافآت المعقدة المكتشفة. بالإضافة إلى ذلك، تُسلط الدراسة الضوء على كيف يمكن لتعزيز نجاح المجموعات النسبية في RLVR أن يزيد من المعلومات المكتسبة حول المكافآت.
ختامًا، تؤكد هذه النتائج على أهمية استخدام التعلم الموجه كنقطة انطلاق فعالة للتعلم المعزز الذكي، وتوضح كيف يمكن لاكتشاف المكافآت الأولية أن يسهم في تسريع الأداء المرغوب به.
اكتشاف المكافآت من خلال التعلم المعزز: استراتيجية تدفئة فعالة للمُعززات الذكية!
تقدم دراسة جديدة حول التعلم المعزز مع المكافآت القابلة للتحقق (RLVR) طريقة مبتكرة لتدريب الوكلاء. حيث اكتشف الباحثون ظاهرة تسريع السياسة التي تعزز الأداء العالي من خلال استخدام التعلم المعزز الموجه.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
