يُعد التعلم المعزز مع المكافآت القابلة للتحقق (RLVR) أحد التطورات المثيرة في مجال الذكاء الاصطناعي، حيث يُعزز من قدرات النماذج اللغوية الكبيرة (Large Language Models) من خلال تحسين قدراتها في التفكير. ومع ذلك، تعتمد هذه التقنية على استكشاف مكلف للغاية للعينات، مما يطرح تساؤلات حول كفاءة تخصيص موارد الاستكشاف.

من المعروف أن تخصيص نفس ميزانية الاستكشاف للعينات ذات مستويات الصعوبة المختلفة يعد أسلوبًا غير فعال؛ حيث قد تتلقى العينات السهلة استكشافات زائدة، بينما قد تجد العينات الصعبة، والتي يمكن تعلمها، نفسها تتلقى استكشافات غير كافية. تجاهلت الطرق التقليدية لتقدير الصعوبة هذه المشكلة، حيث كانت تعتمد على نظام اختيار المناهج (curriculum-based sample selection) وتخصيص غير متسق للاكتشاف استنادًا إلى تقديرات الصعوبة، ما أدى إلى التحديات الجديدة.

لذا، اقترح الباحثون نظام تقدير صعوبة يعتمد على الرسوم البيانية، والذي يستفيد من التغذية الراجعة للاكتشافات ويقوم بتحديث تقديرات الصعوبة بشكل مستمر دون الحاجة إلى استكشاف مخصص. يبدأ النظام بتشكيل رسم بياني يعتمد على الصعوبة، حيث يتم تجميع العينات ذات الصلة بسبب التشابهات الدلالية والمنطقية. من خلال هذا الأسلوب، يتم تشجيع العينات المجاورة على مشاركة نفس حالة الصعوبة باستخدام نموذج بايتا-بينوميال (Beta-Binomial Model) لجمع النتائج المرتبطة بكل حالة.

عبر استخدام خوارزمية تقليل الجهد التكراري (mean-field variational algorithm)، يتم تحديث تقديرات الصعوبة لتمكين استكشاف متكيف يتناسب مع مستوى صعوبة العينات. وقد أثبتت التجارب عبر نماذج أساسية مختلفة وجداول زمنية تعلم معزز ومقاييس أن هذا الإطار الجديد يحقق أداءً أفضل بشكل ملحوظ.

إن التطورات في هذا المجال توفر آفاقًا جديدة في تعزيز كفاءة التعلم الذاتي في الأنظمة الذكية، وهو ما قد يُحدث فارقًا كبيرًا في كيفية تدريب النماذج اللغوية والتعامل مع تحديات التعلم المعزز.