في عالم الذكاء الاصطناعي، يعتمد تدريب نماذج المكافآت (Process Reward Models - PRMs) تقليديًا على تسميات دقيقة يتم الحصول عليها إما من خلال عملية مكلفة تتطلب التقييم البشري أو اعتمادًا على إجابات صحيحة مسبقًا. هذا الأمر يحد من القدرة على توسيع نطاق الإشراف بناءً على العمليات. هنا يأتي دور ScalePRM، الابتكار الثوري الذي يقدم بديلاً متميزًا من خلال توسيع قدرة التحقق.

يعمل ScalePRM عن طريق توليد تقييمات مستقلة متعددة لكل خطوة من خطوات التفكير، ثم تجميع قرارات هذه التقييمات لتوفير تسميات صناعية تكفل الدقة دون الحاجة للبيانات الحقيقية. يقدم هذا النظام استراتيجيتين رائدتين لتوسيع قدرات الاستدلال: التوسيع المتوازي من خلال الاتساق الذاتي، والتوسيع المتسلسل من خلال النقد الذاتي.

عند تطبيقه على مسابقة ProcessBench، التي تستهدف تحديد الأخطاء في خطوات الاستدلال الرياضي، أظهرت النماذج المدربة على بيانات الاتساق الذاتي تحقيق معدل 67.5 في الاختبارات، متجاوزة التدريب التقليدي الذي يعتمد على البيانات الحقيقية (66.4). كما أن نظام Qwen2.5-Math-7B، الذي يستخدم كإشارات مكافأة في تدريب التعلم المعزز، تفوق أيضًا بمعدل دقة بنسبة 47.4% عبر ستة معايير رياضية.

تعكس هذه النتائج قدرة ScalePRM على تجاوز الأساليب التقليدية، مما يجعله بديلاً قابلاً للتطبيق لتدريب نماذج المكافآت بناءً على التحقق بدلاً من الاعتماد على البيانات الحقيقية. إذا كنت مهتمًا بمستقبل الذكاء الاصطناعي والتعلم الآلي، فإن ScalePRM يمثل خطوة مهمة نحو تحسين نماذجنا وتوسيع آفاقنا.