مع التطور السريع لنماذج اللغة الكبيرة (Large Language Models - LLM)، تظهر أنظمة الوكلاء المعززة بها إمكانية هائلة في معالجة المهام المعقدة، وخاصة تلك التي تتطلب التفكير متعدد الخطوات أو التفاعل مع الأدوات. لتحقيق أقصى استفادة من تقنيات LLM، يجب تنفيذ مرحلة ما بعد التدريب بطريقة مدروسة على عدة سيناريوهات وكيلية لاكتساب أداء أفضل.

تعتبر طرق المحاذاة مثل PPO (Proximal Policy Optimization) وDPO (Direct Preference Optimization) وDIL (Data-Independent Learning) وGRPO (Generalized Reinforcement Policy Optimization) من التقنيات الشائعة وذلك لأنها تظهر تأثيراً إيجابياً ملحوظاً على أداء النموذج من خلال معاقبة العينات السلبية مع الحفاظ على تعقيد تدريبي مقبول. ومع ذلك، تتعامل معظم طرق المحاذاة مع مهام بسيطة تدور في إطار دورة واحدة، مما يترك مجالاً للتحسين في المهام المعقدة ذات الدورات المتعددة.

هنا نقدم تقنية جديدة تُعرف باسم تقدير الكثافة متعددة المقاييس على مستوى الدور (Turn-level Multiscale Density Ratio Estimation - tlm-DRE) تتضمن تخصيص أوزان مختلفة للأدوار المقابلة وتقديم تدريب غير متوازن على مستوى الرموز بناءً على الفجوات بين الأماكن الإيجابية والسلبية عبر عدة أدوار من المهام.

تظهر النتائج التجريبية على مجموعة واسعة من معايير الوكلاء أن الطريقة المقترحة تؤدي بشكل تنافسي مقارنةً بطرق المحاذاة التقليدية. هذه الطريقة التدريبية تمكّن نماذج اللغة الكبيرة (LLMs) من العمل بشكل قوي في مهام التفكير متعدد الأدوار في ظروف ترتبط بالمجال وغير المرتبطة به.