شهد التعلم المعزز (Reinforcement Learning) نجاحاً ملحوظاً في مجموعة متنوعة من المهام المعقدة، إلا أن نتائجه تتسم غالباً بعدم الاستقرار العشوائي. يرتبط الأداء المتوقَع والاختلاف في النتائج بتكوينات المعاملات الهيبر (Hyperparameter) التي يعتمد عليها النموذج.
لذا، نقدم لكم طريقة جديدة يُطلق عليها تحسين بايزي هترواسكدستيكي فعال ومتعاطي مع المخاطر (Efficient and Risk-Aware Heteroscedastic Bayesian Optimization) والمعروفة اختصاراً بـERAHBO. هذه الطريقة تعمل على نمذجة كل من المتوسط والانحراف المعياري للنتائج التعليمية كوظائف لتكوينات المعاملات الهيبر.
تهدف ERAHBO إلى تحديد التكوينات التي تحقق عوائد مرتفعة مع تقليل التباين عبر جولات التدريب المختلفة. كما أنها تحسن الكفاءة في عينة المعاملات الهيبر من خلال إعادة أخذ العينات التكيفية، بدلاً من الاعتماد على ميزانية ثابتة لكل مجموعة من تلك المعاملات.
أظهرت التقييمات التجريبية عبر عدة خوارزميات وظروف للتعلم المعزز أن ERAHBO تتفوق من حيث الأداء على المعايير السابقة التي تتعامل مع المخاطر، مما يزيد من كفاءة العينة في تحقيق العوائد الآمنة.
تحسين متقدم باستخدام الأمثل البايزية الهترواسكدستية لإدارة المخاطر في التعلم الذاتي المعزز
تقدم طريقة تحسين متقدمة تجمع بين فعالية التوقعات وأمان المخاطر في مجال التعلم الذاتي المعزز. تعزز هذه الطريقة الكفاءة في نموذج التعلم مع تقليل التباين، مما يفتح آفاقاً جديدة في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
