تشهد نماذج اللغة المتطورة (Diffusion Large Language Models - dLLMs) تقدمًا مذهلاً في قدرتها على توليد نصوص متقنة من خلال تقنية إزالة الضوضاء، مما يسمح بالكشف عن عدة رموز في وقت واحد. ومع تقدم الذكاء الاصطناعي، تم إدخال مفهوم التعلم التعزيزي مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) الذي يعيد استخدام التعليقات النهائية عبر قرارات متعددة بينما يتغير السياق.

في هذا السياق، تم اقتراح تقنية جديدة تُسمى GRPO الحساسة للمخاطر التقدمية (Stepwise Risk-Sensitive GRPO) التي تعدل معامل المخاطر في تحويل ميزة المجموعة عبر حالات إزالة الضوضاء، مع الاحتفاظ بالمدرب الأساسي. ومن خلال مكافآت ثنائية، يُظهر هذا التحويل أنه يمثل بالتحديد تعديلًا يعتمد على السياق والنتيجة.

تقدم عملية المعايرة القائمة على القدرات مقاييس لمعامل المخاطر، كما تتيح دراسات الإزالة، اختيار الجداول المناسبة. وبينما تم اختبار هذه التقنية عبر عدة نماذج dLLM ومعايير التفكير الرياضي، أظهرت النتائج تحسنًا ملحوظًا في الدقة (pass@1) ونسبة التغطية (pass@k) مقارنةً بالتقنيات السابقة، مع زيادة في تنوع الإجابات. تُظهر دراسات الإزالة أيضًا أن هذه المكاسب تتجاوز السلاسل النهائية للإجابات، مما يُعزز تأثير هذه التقنية في مجالات الذكاء الاصطناعي المتقدمة.