في عالم الذكاء الاصطناعي، قدمت نماذج مكافآت العمليات (PRMs) حلولاً فعّالة للتعلم الآلي والتوسع في اختبار الأداء. ورغم تفوقها الكبير في تقديم إشارات دقيقة لتقييم مراحل الاستدلال الوسيطة، إلا أنها كانت تعتمد بشكل كبير على تكاليف التصنيف المعقدة للعمليات. لكنَّ التطور الأخير الذي يحمل اسم انتشار حالة الاستدلال (RSP) يقدم حلاً مستدامًا لمعالجة هذه المشكلة.

تُظهر الأبحاث أن RSP يمثل كل استدلال أولي بحالة صلاحية ثنائية، مما يسمح بنمذجة التحولات بين الحالات المتعاقبة عبر مسار الاستدلال. إذ يحدد هذا النموذج احتمال انهيار حالة صالحة إلى حالة غير صالحة، وكذلك احتمال إصلاح الحالة غير الصالحة إلى حالة صالحة مرة أخرى. من خلال ربط هذه التحولات، يتيح RSP إشراف التصنيفات العملية على الحالات المتوسطة، بينما توجّه العلامات الناتجة التعلم نحو الحالة النهائية.

نتائج الأبحاث تشير إلى أن نموذج RSP يتفوق باستمرار على نماذج PRMs التقليدية، حيث حقق متوسط تحسينات تجاوزت 5.6% في البحث الشعاعي و2.1% في التعلم التعزيزي مقارنةً بنموذج Qwen2.5-Math-PRM. هذا الاختراق العلمي يعد خطوة هامة في تحسين استراتيجيات التعلم وتعزيز قدرة الأنظمة على التعلم من الأخطاء وتحسين الأداء.