تشير الدراسات الحديثة إلى أن "تحسين السياسات المرجعية النسبية (RRPO)" يمثل خطوة ثورية في مجال التعلم المعزز. يأتي هذا الابتكار بعد النجاحات الكبيرة لنموذج "تحسين السياسات النسبية الجماعية (GRPO)", الذي أثبت فعاليته باستخدام تعليقات قابلة للتحقق.

ومع ذلك، يواجه الباحثون تحديات في توسيع نطاق تحسين السياسات الجماعية ليشمل إعدادات لا يمكن التحقق منها بشكل واضح. ولتجاوز هذه العقبة، اقترحت الدراسة استخدام "المقارنات المرجعية النسبية" بدلاً من الاعتماد على المعايير الصحيحة المباشرة.

تعتمد استراتيجية RRPO على "الإطلاقات الشرطية المتدرجة" التي تساعد في تشكيل مجموعات إيجابية وسلبية من النقاط المرجعية. بعد ذلك، يتم تدريب نموذج لتقدير الفروق بين هذه المجموعات، مما يمكن من تنفيذ تحسينات فعالة في السياسات بشكل متناسق.

لقد أثبتت الاختبارات أن RRPO تتفوق على الأطر التقليدية، حتى في الظروف التي تفتقر فيها إلى مصداقية المعايير. وهذا يشير إلى أنها قد تكون البديل الأكثر قوة لتحسين السياسات في المواقف المعقدة.

تابعوا تطورات هذا النموذج الواعد، وكيف يمكن أن يؤثر على مجالات مثل التفكير القابل للتحقق، والجيل المفتوح، وغيرها من التطبيقات المثيرة في الذكاء الاصطناعي.