في ظل التطورات المستمرة في مجال الذكاء الاصطناعي، تأتي تقنيات تعلم التعزيز الوكيلة (Agentic Reinforcement Learning) لتمنح الوكلاء القدرة على التعلم من خلال التفاعل. إلا أن واحدة من التحديات الرئيسية التي تواجه هذه التقنيات هي المكافآت النادرة على مستوى المسار، حيث تظهر فوز الوكلاء دون تحديد القرارات الوسيطة التي تستحق التقدير.

كاستجابة لهذه التحديات، تم طرح إطار عمل جديد يسمى "تعلم التعزيز الوكيلة بتحسين المكافآت الذاتية" (ADRS). يهدف هذا الإطار إلى تصميم نظام يتسم بالدقة في تقدير المكافآت المرتبطة بالقرارات، وذلك عبر بناء رموز مرتبطة بالعائدات لكل تفاعل.

يتناول الإطار الجديد كيفية توحيد وتطبيع نتائج المعلمين ضمن كل خطوة، كما يقوم بتعديلها باستخدام بوابة "مزايا القيمة المعلمية المرتبطة بالعائد" (Teacher Value Advantage - TVA) اعتمادًا على الثقة والرابط بين العائدات. يُعزز الإطار من بناء المكافآت الأصلية مع الحفاظ على التدريب بدون مهارات.

من خلال تجارب تمت عبر ثلاثة معايير تفاعلية، أثبتت تقنيات ADRS أنها تدعم الأداء المحسن في المهام الطويلة الأمد، حيث استمرت المكاسب عبر بنى RL المختلفة وبيئات بيانات مخفضة. تجسد هذه النتائج خطوة مهمة نحو تحسين أداء النماذج اللغوية على المهام المعقدة.

يمكن للمهتمين بالتفاصيل التقنية الوصول إلى الكود المستخدم في هذه الأبحاث عبر هذا الرابط: رابط الكود.

ما رأيكم في هذا الإطار الجديد؟ هل تعتقدون أنه يمكن أن يُحدث ثورة في كيفية تعلم النماذج اللغوية؟ شاركونا آرائكم في التعليقات!