في عصر الذكاء الاصطناعي، يظهر نموذج جديد يدعى DiDPO (تحسين سياسة الفرق في الفرق) كأحد الإنجازات البارزة في تدريب الوكلاء البرمجيين. تعتمد هذه الطريقة على مفهوم التعلم المعزز مع مكافآت قابلة للتحقق (Verifiable Reward)، مما يتيح تنفيذ تغذية راجعة موضوعية من خلال الترجمة والاختبارات البرمجية.

يواجه الوكلاء البرمجيون تحديات فريدة تتعلق بتقدير النتيجة، حيث تمثل كل خطوة من خطوات البرمجة تغيرات متعددة في مناطق مختلفة من النسخة البرمجية. هذا الأمر يجعل من الصعب تمييز مساهمة التغييرات المستقلة. حتى الآن، استعانت الطرق الحالية بمكافآت مخرجات أو مكافآت على مستوى الخطوة، الأمر الذي لم يحقق الفائدة المرجوة وترك بعض الخصائص الفريدة للعملية البرمجية كخارج نطاق التدريب.

مع DiDPO، يتم تطوير وحدات تقدير دقيقة مباشرة من هيكل الاختلافات البرمجية (code diffs)، حيث يُنظم التفاعل البرمجي إلى خطوات تفكير وإجراءات متعددة، مما يتيح اكتشاف الاختلافات عبر مسارات عينة.

يتم اختيار نقاط مرجعية من خلال تجميع اختلافات فرعية متشابهة، وتوفر نقاط التوزيع محاور توازن مثلى بين نطاق المحتوى ومجموعات العمل形成ها. تساهم هذه النقاط في تشكيل مجموعات ميزة، وتعيد تقدير المزايا على مستوى التغييرات إلى الرموز الاستجابة الفردية.

أظهرت التجارب على معايير البرمجة الطويلة أن DiDPO يتفوق بشكل ملحوظ على النماذج التقليدية، حيث حقق أداءً متفوقاً بأكثر من 10% في نموذج Qwen2.5-7B-Coder، مستعرضاً إطار عمل مبدئي لتقدير النتائج بدقة في تدريب الوكلاء البرمجيين.

علاوة على ذلك، تم فتح مصدر قاعدة بيانات verl-code، التي تدعم مجموعةً متنوعة من طرق التعلم المعزز ومعايير البرمجة، مما يسمح للمطورين بالتعاون والاستفادة من هذه الأبحاث المتقدمة.