في عالم الذكاء الاصطناعي، يشكل التعلم المعزز بالمكافآت القابلة للتحقق (RLVR) خطوة جديدة نحو تحسين نماذج اللغة الكبيرة (LLMs)، خصوصًا عند التعامل مع مهام تتطلب reasoning معقد. لكن، بقيت قابلية تطبيق هذا النموذج محدودة في مجالات مثل الرياضيات والترميز حيث يمكن التحقق من صحة النتائج بشكل قاطع.

عادةً ما تعتمد المهام المفتوحة على تفضيلات بشرية أو نماذج للمكافآت أو قضاة معتمدين على نماذج اللغة، مما يعرضها لعدة مشكلات، مثل التحيز في التقييم وقيود قدرات القضاة وتكاليف الاستدلال.

هنا يأتي دور نموذج التعلم المعزز بالمكافآت ذاتية التحقق (RLSVR)، الذي يعتمد على مبدأ التعلم الذاتي للإشراف، مما يعني أنه يخلق مهام تمهيدية للحصول على إشراف من البيانات نفسها. RLSVR يعيد تشكيل المهام المفتوحة إلى بيئات عكوسة قادرة على إنتاج إشارات مكافأة آلية.

تم استحضار RLSVR باستخدام **SpyRL**، وهو بيئة لعب جماعي تعتمد على مفهوم “من هو الجاسوس؟”. في هذه البيئة، يتلقى الوكلاء معلومات غير متكافئة، ويقومون بإكمال نفس المهمة، ثم يصوتون لتحديد الجاسوس المخصص. نظرًا لأن هويات الجواسيس محددة مسبقًا، فإن نتائج التصويت توفر مكافآت يمكن التحقق منها بالكامل، بينما تبقى عملية التعرف الناجحة مرتبطة ارتباطًا وثيقًا بجودة المخرجات.

أظهرت التجارب على تلخيص النصوص، الكتابة الإبداعية، والرياضيات أن SpyRL يتفوق على الأساليب الموجودة لتحسين الذات في المهام التي لا يمكن التحقق منها، ويحقق مكاسب ثابتة في المهام القابلة للتحقق. هذه النتائج تؤكد أن تحول المهام يمكن أن يوسع نطاق تحسين الذات المعتمد على RLVR إلى مجالات جديدة تفوق المجالات القابلة للتحقق.

يمكنكم اكتشاف المزيد حول SpyRL والتطبيقات العملية لهذا النموذج عبر زيارة الرابط GitHub – SpyRL. ما رأيكم في هذه التطورات الجديدة؟ دعونا نناقش ذلك في التعليقات.