خلال السنوات الأخيرة، أصبح التعلم المعزز (Reinforcement Learning - RL) يعتمد بشكل متزايد على مزايا المجموعة النسبية، مما جعله معياراً قياسياً في الكثير من التطبيقات، بما في ذلك نماذج اللغة. رغم ذلك، تواجه الأساليب التقليدية عند تحسين عدة أهداف مكافأة بعض التحديات الهامة التي تؤثر سلباً على أداء الأنظمة.

تتمثل المشكلة الأساسية في أنه عند استخدام مجموعات وزنية ثابتة لقياس المكافآت، يمكن لمجموعات مختلفة من المزايا أن تحصل على نفس النتائج أو التقييمات، وهذا يقود إلى توزيع الجهود على أهداف تم تحقيقها بالفعل. كانت النتيجة هي تخصيص الموارد بشكل غير صحيح، حيث يستمر التدريب على الأهداف المشبعة بدلاً من التركيز على تلك التي لديها المزيد من الفرص للتحسين.

لاستدراك ذلك، تم تقديم تقنية جديدة تُعرف بإعادة وزن المزايا الواعية بالإشباع للتعزيز متعدد المكافآت (Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization - SA-MRPO). تتيح هذه التقنية لكل هدف مكافأة أن يُوزّن بشكل مستقل، حيث يتم تعديل مساهمته بناءً على تقدير مستوى الإشباع.

هذه العملية الديناميكية تهدف إلى إعادة تخصيص الجهود نحو الأهداف التي تحتاج لتحسين أكبر، مع الحفاظ على الأداء للأهداف التي تم تحقيقها بالفعل. بالإضافة إلى ذلك، يمكن لإعادة الوزن الواعية بالإشباع عكس اتجاه التحديث، وليس مجرد تغيير حجمه.

أظهرت التجارب أن تقنية SA-MRPO تفوقت على الطرق السابقة مثل GDPO في 12 من 15 مقارنة معايير، حيث حققت مكاسب تصل إلى 5% في مستوى الدقة في معالجة المسائل الرياضية. في السياقات التكيفية، حققت هذه التقنية تحسناً بمتوسط 3.8% مع وصول معدل النجاح في الاختبارات البرمجية إلى 2.3%، مع الحفاظ على الأهداف الأكثر سهولة عند مستوياتها المشبعة.