في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغات القابلة للتشتت (Diffusion Language Models - dLLMs) بديلاً واعداً لنماذج اللغات التلقائية (Autoregressive LLMs). ومع ذلك، فإن ضعف تقنيات ما بعد التدريب، خصوصاً في تطبيقات التعزيز (Reinforcement Learning - RL)، يُشكل تحدياً رئيسياً. في هذا السياق، تبرز خوارزمية 'تحسين السياسة الجماعية المقرونة (Amortized Group Relative Policy Optimization - AGRPO)' كحل مبتكر.

تستفيد هذه الخوارزمية من الطبيعة العشوائية لنماذج dLLMs، حيث تركز على تحسين خطوات إزالة الضوضاء الفردية بدلاً من معالجة تسلسلات كاملة. باعتمادها على هذه التقنية، تضمن AGRPO توافقًا أفضل بين السياسة المدربة وعملية الاستنتاج، كما تتيح تحديثات فعالة لعوامل التحكم غير المتحيزة من خلال تقنية تقدير جديدة للوقت.

أظهرت AGRPO فعاليتها في مجموعة من مهام الرياضيات والتفكير، محققةً زيادات دقة غير مسبوقة تصل إلى +59.4% في لعبة العد التنازلي (+ Countdown) و+69.7% في لعبة سودوكو (+ Sudoku) مقارنةً بالنموذج الأساسي LLaDA. والأهم من ذلك، أن أدائها يفوق طرقاً مشابهة مثل diffu-GRPO.

لمزيد من التفاصيل، يمكنكم زيارة الصفحة الخاصة بالخوارزمية على GitHub: https://github.com/probablyabot/agrpo.