خلال السنوات الأخيرة، أصبح التعلم المعزز (Reinforcement Learning - RL) يعتمد بشكل متزايد على مزايا المجموعة النسبية، مما جعله معياراً قياسياً في الكثير من التطبيقات، بما في ذلك نماذج اللغة. رغم ذلك، تواجه الأساليب التقليدية عند تحسين عدة أهداف مكافأة بعض التحديات الهامة التي تؤثر سلباً على أداء الأنظمة.
تتمثل المشكلة الأساسية في أنه عند استخدام مجموعات وزنية ثابتة لقياس المكافآت، يمكن لمجموعات مختلفة من المزايا أن تحصل على نفس النتائج أو التقييمات، وهذا يقود إلى توزيع الجهود على أهداف تم تحقيقها بالفعل. كانت النتيجة هي تخصيص الموارد بشكل غير صحيح، حيث يستمر التدريب على الأهداف المشبعة بدلاً من التركيز على تلك التي لديها المزيد من الفرص للتحسين.
لاستدراك ذلك، تم تقديم تقنية جديدة تُعرف بإعادة وزن المزايا الواعية بالإشباع للتعزيز متعدد المكافآت (Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization - SA-MRPO). تتيح هذه التقنية لكل هدف مكافأة أن يُوزّن بشكل مستقل، حيث يتم تعديل مساهمته بناءً على تقدير مستوى الإشباع.
هذه العملية الديناميكية تهدف إلى إعادة تخصيص الجهود نحو الأهداف التي تحتاج لتحسين أكبر، مع الحفاظ على الأداء للأهداف التي تم تحقيقها بالفعل. بالإضافة إلى ذلك، يمكن لإعادة الوزن الواعية بالإشباع عكس اتجاه التحديث، وليس مجرد تغيير حجمه.
أظهرت التجارب أن تقنية SA-MRPO تفوقت على الطرق السابقة مثل GDPO في 12 من 15 مقارنة معايير، حيث حققت مكاسب تصل إلى 5% في مستوى الدقة في معالجة المسائل الرياضية. في السياقات التكيفية، حققت هذه التقنية تحسناً بمتوسط 3.8% مع وصول معدل النجاح في الاختبارات البرمجية إلى 2.3%، مع الحفاظ على الأهداف الأكثر سهولة عند مستوياتها المشبعة.
تحسين خيارات السياسات المتعددة: تقنية جديدة تضمن فعالية أكبر في التعلم المعزز
تم تقديم تقنية مبتكرة تسمى "إعادة وزن المزايا الواعية بالإشباع" لتحسين أساليب التعلم المعزز المتعددة الأهداف. هذه التقنية الجديدة تعد بإعادة توجيه الجهود نحو الأهداف غير المحققة وتضاعف الأداء بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
