تظل عملية منح الفضل للخطوات المتوسطة تحديًا مركزيًا في تدريب نماذج اللغات الضخمة (Large Language Models) على المهام التي تتطلب تفكيرًا متعدد الخطوات مع مكافآت نهائية نادرة. تسعى طرق الممثل-الناقد مثل PPO إلى معالجة هذا التحدي من خلال تعلم دوال القيمة لبناء ميزات على مستوى الرموز. ولكن فعالية هذه الطرق تعتمد بشكل حاسم على تقدير قيمة موثوق، وهو أمر صعب يتطلب من الناقد أن يقيم التقدم نحو حل صحيح ويتوقع سلوك السياسة المتطورة في المستقبل. أي أخطاء في هذه العملية يمكن أن تؤدي إلى عواقب سلبية على عملية منح الفضل وتزعزع تدريب النماذج عبر الإنترنت.
في هذه الدراسة، نعيد النظر في الصياغة التقليدية لتقدير القيمة المعتمدة على الحالة فقط، ونقترح تقنية جديدة تُعرف بإطار 'πPPO'، وهي إطار مُعزز ذاتيًا يعتمد على جمع البيانات السابقة المُعتمدة. من خلال إعادة استخدام نتائج تم التحقق منها لنفس المدخلات كمستندات مقارنة، يُساعد 'πPPO' الناقد على تقييم التفكير الوسيط بالمقارنة مع محاولات ناجحة وأخرى فاشلة، مع الحفاظ أيضًا على تحسين السياسة القياسي وواجهة النشر.
تظهر التجارب أن 'πPPO' يُحسن جودة تقدير القيمة بشكل ملحوظ ويتفوق على نماذج الممثل-الناقد المعروفة والأساليب الأخرى في نقاط مرجعية تحديّة تتعلق بالتفكير الرياضي، كما أنه يظل فعّالاً حتى عند اقترانه بناقدات غير متكافئة أصغر حجمًا.
ابتكار ثوري في تقدير القيمة: إعادة صياغة أنظمة التعلم باستخدام إطار مُعزز ذاتيًا!
يقدم البحث الجديد تقنية مبتكرة تُعيد تشكيل تقدير القيمة في نماذج الذكاء الاصطناعي، مستعينًا بإطار مُعزز ذاتيًا يساهم في تحسين دقة التقديرات. هذه الخطوة تُعزز من فعالية استراتيجيات التعلم وتعالج تحديات بارزة في معالجة المهام متعددة الخطوات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
