في عالم متسارع من التطورات التكنولوجية، يُظهر التعلم المعزز مع المكافآت القابلة للتحقق (Reinforcement Learning with Verifiable Rewards - RLVR) قدراً كبيراً من القدرة على تعزيز القدرات الاستدلالية لنماذج اللغة. ومع ذلك، فإن الطبقة الأساسية التي تترجم استجابات المكافآت إلى تحديثات في هيكل الوزن لا تزال غير مفهومة بشكل كافٍ.
استناداً إلى التحليل السابق الذي أجرته مجموعة زو (Zhu et al.) في عام 2025، تمكنا من دراسة هذه الطبقة المفقودة من خلال الهيكل الفريد لأوزان النموذج. أحد الاكتشافات الرئيسية كان مفهوم "الإرث الطيفي" (Spectral Inheritance)، حيث يمكن لـ RLVR إعادة استخدام طيف الأوزان للنموذج الأساسي أثناء اكتساب سلوكيات جديدة عبر تغييرات في الأطر المدخلة والمخرجة المرتبطة.
تُعرف هذه العملية الجديدة باسم "تحسين الطيف المتجانس" (Isospectral Optimization - ISO)، والتي تمثل إطار عمل لتحسين متسق مع مكافآت RLVR، حيث تجمع بين تقنيات تطوير بطريقتين: خارجية (offline) وداخلية (online). في الوضع الخارجي، يُعد ISO-Merger هو الحل الأمثل الذي يمزج التغييرات الإطارية لعدد من المتخصصين ذوي القاعدة المشتركة إلى نموذج ثابت الطيف دون الحاجة إلى بيانات إضافية أو تحديثات تكرارية.
أما في الوضع الداخلي، فإن ISO-Optimizer يُطبق مُحسّناً مختاراً، مثل AdamW وMuon، على المتغيرات الإطارية مع الحفاظ على ثبات الطيف الأساسي. في مهام الاستدلال والترميز التي تتراوح بين 1.5 مليار إلى 8 مليارات معامل، قدم ISO-Optimizer تحسيناً في الدقة، وتحقيق النتائج بشكل أسرع بكثير من الطرق التقليدية، حيث تحقق تقنية ISO-AdamW نفس مستوى الدقة المُسجلة بعد 100 خطوة تدريب فقط.
بالتالي، تقدم تقنية ISO إجابة واضحة على أوجه القصور في الطبقة المفقودة للتحديث في تقنيات RLVR: بدلاً من وراثة تحسين ما قبل التدريب بشكل كامل، يتم تصميم ما بعد التدريب حول هيكل التكيف المدفوع بالمكافآت، مما يوفر استجابة أكثر دقة وفعالية.
اكتشاف تقنية جديدة في التعلم المعزز: إعادة هيكلة استراتيجيات تحسين نموذج ISO
تقدم تقنية تحسين النموذج ISO ثورة في التعلم المعزز مع مكافآت قابلة للتحقق، مما يعزز قدرات نماذج اللغة. هذه التقنية تقدم مستوى جديد من الكفاءة في التكيف مع السلوكيات الجديدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
