في عالم الذكاء الاصطناعي، يمثل التعلم المعزز (Reinforcement Learning) وسيلة قوية تسمح لوكلاء النماذج اللغوية الكبيرة (Large Language Models) بتعلم سلوكيات متعددة الخطوات من خلال التفاعل مع بيئاتهم. ومع ذلك، تواجه هذه الوكلاء تحدياً كبيراً، حيث تقتصر المكافآت في العديد من المهام التفاعلية على النتيجة النهائية فقط، مما يُعطي توجيهاً محدوداً حول القرارات الوسيطة المهمة التي تسهم في تحقيق النجاح.

للتغلب على هذه المشكلة، تم تقديم طريقة جديدة تُدعى "تحسين السياسة من المسار إلى الخطوة" (Trajectory-to-Step Policy Optimization – T2SPO). تعتمد هذه الطريقة المبتكرة على استخدام المسارات التفاعلية السابقة لتوفير ملاحظات على مستوى الخطوة لتعزيز تعلم السياسة.

تقوم T2SPO بصياغة أهداف المسافة المتبقية من المسارات الناجحة، وتزاوجها مع تمثيلات الحالات التي تمت زيارتها على طول الطريق. ومن خلال استخدام أمثلة هؤلاء الوكلاء، تقوم خوارزمية تقدير معينة تُعرف بـ TabPFN بعمليات تقدير للمسافة المتبقية للنجاح في كل حالة من حالات العرض الجديدة.

تُظهر التجارب التي أجريت على نماذج لغوية بقدرة 1.5 مليار و7 مليارات عنصر، في بيئات مثل ALFWorld وWebShop، أن T2SPO تحسن بشكل ثابت من النجاح الإجمالي مقارنة بطريقة GRPO التقليدية.

تستمر T2SPO في تحديث سياقها بفضل التجارب الجديدة المكتملة، مما يسمح بإدماج الخبرات الجديدة دون الحاجة إلى تحديث المعلمات الخاصة بها. إن هذه الابتكارات تمثل خطوة كبيرة نحو تحسين الكفاءة والتواصل في الأنظمة الذكية، مما يفتح آفاقاً جديدة في تطبيقات التعلم المعزز.