تعتبر خوارزمية Group Relative Policy Optimization (GRPO) واحدة من الأكثر شهرة في مجال التعلم المعزز بالتعاون مع نماذج اللغات الضخمة (Large Language Models). ومع ذلك، فإن GRPO تواجه مشكلة كبيرة تتعلق باحتمالية عدم الاستقرار أثناء التدريب، والتي تنتج عن طريقة القص الخاصة بها.
توصل الفريق البحثي إلى أن استخدام GRPO يُمكّن من استبدال فوائد مستوى التوكن (token-level advantages) بفائدة على مستوى التسلسل (sequence-level advantage)، لكن هذه الطريقة تترك ربعًا واحدًا - الذي يجمع بين فائدة سلبية ونسبة احتمال مرتفعة، غير محصن بشكل هيكلي. يعني ذلك أن بعض التوكنات ذات النسبة العالية قد تتلقى تحديثات كبيرة ساحقة، مما يؤدي إلى تقليص الانتروبيا (entropy) وتقليص حدود التفكير.
لحل هذه المشكلة، تمكن الفريق من تقديم أسلوب All-Quadrant Bounded Clipping GRPO (ABC-GRPO). هذا الأسلوب يطبق القص غير المشروط في جميع الأرباع من خلال حدود تعتمد على الإشارة. يقوم ABC-GRPO بقص نسبة الاحتمال قبل ضربها في الفائدة، مما يضيف حدّ الثقة في الربع الثاني وحدّ في الربع الرابع، ما يسمح بتقليل التحويل السياسة لكل خطوة في جميع الأرباع.
أظهرت النماذج الأساسية Qwen3 أن ABC-GRPO يحقق نتائج مذهلة في اختبارات التفكير الرياضي (Avg@64) والنجاح (Pass@64)، متفوقًا بشكل إحصائي على GRPO وSAPO وdual-clip PPO، ويعتمد بقوة على الأفضل في المجال (DAPO)، بينما يحافظ على انتروبيا أعلى بكثير. كما أن النتائج تعكس تحسنًا في MATH-500 وفي التعليمات البرمجية خارج المجال (HumanEval).
باختصار، يفتح ABC-GRPO آفاقًا جديدة في مجال التعلم المعزز ويوفر حلاً مبتكرًا للمشكلات السابقة، مما يساهم في تحسين عمليات التعلم وتوسيع حدود ما يمكن تحقيقه من خلال النماذج.
ما رأيكم في هذا الابتكار الثوري في عالم الذكاء الاصطناعي؟ ندعوكم لمشاركتنا آراءكم في التعليقات!
تحقيق ثورة في التعلم المعزز: أسلوب All-Quadrant Bounded Clipping GRPO يكتشف المناطق الغامضة!
يأتي أسلوب All-Quadrant Bounded Clipping GRPO ليحل مشكلة كبيرة في نماذج التعلم المعزز مع تعزيز الحماية ضد التحديثات الكبيرة. ما الذي يجعله يتفوق على نظيراته؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
