في عالم الذكاء الاصطناعي، تُعتبر نماذج اللغة جزءًا أساسيًا من تقدمنا نحو معالجة اللغة الطبيعية. ومن بين الطرق الفعالة في هذا المجال، عُرف أسلوب Group Relative Policy Optimization (GRPO) كأداة قوية في التعلم المعزز. ومع ذلك، بينت الأبحاث الأخيرة أن GRPO قد يؤدي إلى تقليل قدرة النموذج على الاستدلال، مما يؤثر سلبًا على أدائه في اختبارات Pass@k، خصوصًا عندما تكون الكلمة k كبيرة.
لنفهم أكثر، ما يحدث هو أن GRPO يركز على الاستجابات التي تولدها النماذج بالفعل بنسبة عالية، مما يؤدي إلى تقليل مدى تنوع الخيارات المتاحة للنموذج. وقد عُزيت هذه الظاهرة إلى آليتين رئيسيتين في تحديث GRPO. الأولى ترتبط بمستوى الاستجابة، حيث تهيمن الاستجابات التي تحصل على احتمالية عالية على gradient المجموعة من خلال تكرار ظهورها. الثانية تتعلق بمستوى الرموز، حيث يزيد GRPO من وزن gradient الرموز الأكثر احتمالًا، مما يعزز من تكرار تلك الخيارات.
لكن، خبراء الذكاء الاصطناعي لم يستسلموا لهذه التحديات. بل قدموا أسلوبًا جديدًا يُدعى ReCo، يعمل على إعادة وزن الاستجابات بطريقة تعالج المشكلتين السابقتين. يتم هنا تطبيع المساهمات الاستجابية حسب حدوثها المتوقع ضمن المجموعة، كما يتم الاستعاضة عن نسبة الأهمية بمعدل يعتمد على الفروقات، مما يمنح تقديرًا أفضل للنقاط التي لا تزال خيارات بديلة ممكنة.
عند اختبار ReCo على نماذج مثل Qwen2.5-Math-1.5B/7B وLlama-3.1-8B-Instruct، أظهرت النتائج تحسنًا ملحوظًا في أدائها في مهام التفكير الرياضي مقارنة بأسلوب GRPO التقليدي، مما يعكس قدرة ReCo على تحسين الكفاءة في الاستدلال فائق التعقيد.
واحدة من أبرز النتائج كانت تحسينًا كبيرًا في أداء Pass@k مع القيم الكبيرة لـ k، ما يجعل ReCo أداة واعدة لمواجهة التحديات الحالية في تعلم الآلة. هل ستحول ReCo مشهد التعلم العميق للأفضل؟
ثورة في التعلم العميق: كيفية تحسين نماذج اللغة باستخدام ReCo
تقدم ReCo منهجًا مبتكرًا لتحسين نماذج التعلم المعزز، وتجاوز التحديات التي تواجه Group Relative Policy Optimization (GRPO). النتائج مشوقة، حيث أظهرت ReCo تفوقًا ملحوظًا في أداء النماذج في مهام التفكير الرياضي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
