في عالم الذكاء الاصطناعي، يعد التعلم المعزز من أكثر المجالات إثارة وتحدياً. مؤخرًا، تم الإبلاغ عن أن تقنيات Batch Normalization (BN) تعزز كفاءة النماذج في طرق السيطرة المستمرة مثل CrossQ. لكن المفاجأة كانت في أداء هذه التقنيات في التعلم القائم على القيم المنفصلة، خاصة في الألعاب مثل Atari.
تظهر الأبحاث الجديدة أن التدهور في الأداء ليس كما كان متوقعًا، وذلك بسبب عدم وجود عدم توافق بين مدخلات الإجراءات في شبكات Q المنفصلة كما هو الحال في CrossQ. لكن الفريق البحثي اكتشف أن الخيار البسيط بين استخدام الإحصائيات التشغيلية والإحصائيات الجماعية في مراحل معينة من التدريب يمكن أن يعكس هذا التدهور.
على سبيل المثال، في نموذج C51، تحسين التنفيذ من خلال تغيير وضعيتين الإحصائيتين إلى إحصائيات جماعية أدت إلى تحسين كبير في الأداء مقارنة بالأساليب غير المعيارية وطبقة LayerNorm، حيث ظلت النتائج مستقرة حتى نسبة التحديث إلى البيانات التي تصل إلى 12.
وكذلك في الطريقة PQN، أدى استخدام إحصائيات الجماعة لاختيار التصرفات إلى استعادة الأداء من تهيئة الإحصائيات التشغيلية الفاشلة. عبر 26 لعبة من ألعاب Atari ومعالجة 400 مليون إطار، حققت هذه التهيئة درجات نهائية أعلى من PQN الذي اعتمد على LayerNorm.
خلصت الدراسات إلى أن ضبط Batch Normalization بعناية يمكن أن يحسن بشكل كبير من التعلم القائم على القيم المنفصلة، مما يدل على أهمية إعدادات البروتوكولات العُلوية في تحديد مواصفات الخوارزميات. إن النتائج التي توصلنا إليها تقدم خطوة جديدة في سعي الذكاء الاصطناعي لتحقيق أداء أفضل في مشاريعه المختلفة.
ما رأيكم في هذه التقنيات الجديدة؟ هل تعتقدون أنها ستغير مجرى التعلم المعزز في المستقبل؟ شاركونا آرائكم في التعليقات!
تحسين الأداء في التعلم المعزز: اكتشافات مثيرة حول تقنيات Batch Normalization
تظهر الأبحاث الجديدة أن استخدام تقنيات Batch Normalization (BN) يمكن أن يحسن بشكل كبير من كفاءة التعلم المعزز في الألعاب الثنائية، رغم التحديات التي ظهرت في تعلم القيم المنفصلة. فريق البحث يقدم حلولاً مبتكرة لمواجهة هذه المشكلات وتحقيق أداء أفضل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
