شهدت السنوات الأخيرة إقبالًا متسارعًا على استخدام التعلم المعزز (Reinforcement Learning) في تحسين أداء نماذج اللغة الكبيرة (Large Language Models) بعد التدريب، مما أسفر عن تحسينات كبيرة في مجالات مثل التفكير الرياضي وتوليد الأكواد. لكن، في النظم العملية، قد تؤدي تحديثات السياسات والفروقات بين محركات التنفيذ والتدريب إلى ردود غير مناسبة.
لمواجهة هذا التحدي، يتم استخدام مبدأ "التعتيم على مستوى التسلسل" (Sequence-level masking)، الذي يقرر ما إذا كان يجب أن تساهم الاستجابة بأكملها في عملية التحسين. وتعتمد القاعدة الشائعة على تطبيق متوسط هندسي معيار طول استجابة الرموز العينة. ومع ذلك، فإن النسب اللوغاريتمية الموقعة يمكن أن تلغي بعض التغيرات عند اتجاهات مختلفة، مما يؤدي إلى إخفاء انحرافات ملحوظة في السياسات الثنائية الاتجاه.
وهنا يأتي دور CARM، وهي تقنية جديدة تُعرف باسم "التعتيم الواعي بالإلغاء" (Cancellation-Aware Response Masking)، حيث تأخذ القيمة المطلقة لكل نسبة لوجاريتم الرموز قبل المتوسط، مما يمنع التغيرات المتعاكسة من الإلغاء.
تظهر التجارب على الأداء الرياضي وتوليد الأكواد أن CARM قد حسنت المتوسط بمقدار 3.13 نقاط مئوية مقارنة باستخدام المتوسط الهندسي التقليدي، وزادت من معدل النجاح بمقدار 2.88 نقطة على أربعة معايير لأقوى خط أساسي تم تقييمه.
تظهر هذه النتائج أن CARM ليست مجرد تقنية جديدة، بل هي أيضًا نهج نظري قوي وفعال لضبط استجابة النماذج في التعلم المعزز.
ما رأيكم في هذا التطور الرائع؟ شاركونا بالتعليقات!
ثورة التعلم المعزز في نماذج اللغة الكبيرة: CARM تكشف أسرار الأداء الاستثنائي!
تقدم CARM (Cancellation-Aware Response Masking) نهجًا ثوريًا في التعلم المعزز لنماذج اللغة الكبيرة، مما يزيد من دقة الاستجابات في توليد الأكواد والتفكير الرياضي. اكتشف كيف يحسن هذا النظام الجديد أداء النماذج بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
