في عالم الذكاء الاصطناعي، باتت سياسة تحسين المجموعات واحدة من أبرز الطرق المستخدمة لتدريب النماذج اللغوية الكبيرة (Large Language Models) مثل Qwen2.5-1.5/7B-Instruct. ومع تقدم البحث في هذا المجال، ظهر تحدٍ رئيسي يتمثل في صعوبة مهام الأفق الطويل، حيث غالباً ما تعاني هذه الأساليب من عدم التوازن في أخذ العينات. وعندما يحدث ذلك، تصبح الإجراءات المتكررة أو ذات التأثير المنخفض هي السائدة، في حين تبقى الإجراءات المفيدة غير مختبرة.

تؤدي هذه الظاهرة إلى تكوين مجموعات فاشلة في معظم الأحيان، حيث لا تُسهم المكافآت الناتجة بأي توجيه لتحسين السياسة. ومن هنا جاءت فكرة "تحسين سياسة المجموعات المشروطة بالتقدم" (Progress-conditioned Group Policy Optimization)، أو اختصاراً (ProGPO).

تركز هذه التقنية الجديدة على استخدام التغطية من زيارة الأحداث الأولى فقط عندما تتلقى جميع العينات في مجموعة ما مكافأة صفرية. من خلال القيام بذلك، تعطي (ProGPO) ميزات نسبية أعلى للخطوات التي تزور حالات جديدة، كون الوصول إلى ملاحظات جديدة يعد شرطًا أساسيًا لنجاح المهمة.

تظهر التجارب على معيارين صعبين، ALFWorld وWebShop، تحسنًا ملحوظًا في الأداء عند استخدام (ProGPO)، مما يوفر انطلاقة هائلة في مجالات صعبة تتطلب اتخاذ قرارات ذكية.