في خطوة رائدة نحو تعزيز فعالية النماذج اللغوية في المهام الرياضية، تم تقديم تقنية جديدة تحت مسمى HISPO، والتي تعني "تحسين سياسات أخذ العينات ذات الأهمية وفقًا للهرمية". تأتي هذه التقنية للرد على التحديات التي يواجهها التعلم المعزز مع المكافآت القابلة للتحقق (RLVR)، حيث تقوم بتوزيع المكافآت بشكل أكثر فعالية لتفادي المشكلات المرتبطة بتجزئة المهام.

تواجه النماذج اللغوية في كثير من الأحيان مشكلة توزيع الفضل عند تقديم استجابات طويلة، حيث قد تسهم بعض أجزاء الحل بشكل أكبر في الدقة النهائية مما تسهم به أجزاء أخرى. وتحققت التقنيات التقليدية مثل GRPO وDAPO من تحسين المكافآت على مستوى الرموز، بينما كانت GSPO تستهدف تسلسل الاستجابة ككل. يأتي تطبيق HISPO لتحقيق أفضل النتائج عبر تحسينات على مستوى مقاطع معينة من الاستجابة، مما يساهم في فك تشابك هذه المشكلة المعقدة.

تشتمل الطريقة على بناء مقاطع متتالية مستندة إلى الارتباك في وقت التشغيل، مما يسمح بتوزيع ثابت للأوزان السلوكية اللينة. ومن خلال تطبيق تصحيح أخذ العينات المبني على الهرمية، فإن HISPO تشغل فئة تصحيح وسطي بين الأساليب التقليدية والتي من شأنها رفع مستوى أداء النموذج في مهام الاستدلال الرياضي.

تمت تقييم HISPO من خلال تحسين نموذج Qwen3-1.7B-Base في مهام رياضية مختلفة، حيث أظهرت النتائج تحسنًا ملحوظًا في قياس Pass@8، متفوقةً على جميع المعايير السابقة، بينما تماثلت أو تفوقت في قياس Acc@8 في خمسة من الاختبارات. تشير التحسينات التي حققها HISPO، مثل الزيادة بـ 3.75 نقطة في Acc@8 على مجموعة AIME25، إلى أن تصحيح المقطع يعد خطوة واعدة في تحسين أداء التعلم المعزز للنماذج اللغوية الطويلة.