تطرح دراسة جديدة فرضية مثيرة حول تأثير التعلم المعزز (Reinforcement Learning) على نماذج اللغة الكبرى (Large Language Models) بعد مرحلة التدريب. وفقاً للنتائج، يبدو أن التدريب اللاحق يُشدد من سلوكيات النموذج الأساسي، مما يحسن من الدقة في التجارب الفردية، لكنه يأتي على حساب تغطية الحلول.
على الرغم من أن هذا التبادل تم ملاحظته في مهام الرياضيات والترميز، إلا أنه قد لا يمتد إلى المهام الوكيلة (Agentic Tasks) التي تتطلب استخدام الأدوات والتفاعل في مراحل متعددة.
ما يثير الدهشة، أن نماذج اللغة الكبيرة المُدربة مسبقاً، والمزودة بأدوات استدلال خفيفة، يمكن أن تعمل كعوامل قادرة. ورغم انخفاض دقتها (pass@1) بشكل ملحوظ، غالباً ما تتفوق على نظيراتها المُدربة لاحقاً في تغطية الحلول (pass@K) عندما يكون هناك ميزانية زمنية كافية للاختبار.
تقدم الدراسة تحليلاً لآلية ذلك، وتظهر أن التدريب اللاحق يُدفع بالمهمات نحو طرفين متقابلين: مُنجزة دائماً أو غير مُنجزة أبداً. هذا يؤدي إلى تحسين كفاءة العينة والاتساق، لكن على حساب تغطية الحلول. ولقيس هذا التكلفة، اقترح الباحثون مقياس "ضريبة الشحذ"، وهي مقياس تشخيصي يقيس فقدان قابلية التوسع أثناء الاختبار بعد التدريب.
من خلال تحليل 14 زوجاً من النماذج الأساسية والمُدربة لاحقاً، ومعايير اختبار متنوعة، أثبتت الضريبة أنها منتشرة في معظم الحالات، ويمكن تقديرها من خلال عدد قليل من الجولات، وترتبط بشكل جيد مع مقاييس أخرى. أخيراً، تقدم الدراسة طريقة "المزج الجماعي بمعدل حرارة تم إصلاحها" (Posterior-Tempered Group Sampling) كعينة بايزية سهلة الاستخدام، تتكيف مع درجة حرارة العينة وفقاً لصعوبة السؤال. عند تطبيقها أثناء التدريب في بيئتين وكيلتين، أظهرت أن معالجة درجة الحرارة أقل تكلفة من القاعدة الثابتة، مما يحل المزيد من المهام مع تحسين الدقة في التجارب الفردية.
كشف الغموض عن ضريبة الشحذ: كيف تؤثر تدريبات ما بعد التعلم على نماذج اللغة الكبيرة؟
استكشاف تأثير ضريبة الشحذ على كفاءة أداء نماذج اللغة الكبيرة بعد مرحلة التدريب. تشير دراسة جديدة إلى أن التدريب اللاحق قد يحسن من الدقة في الرسم البياني بسير عبر مجموعة من المهام.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
