مع التوسع السريع في استخدام نماذج Mixture-of-Experts (MoE) في عالم الذكاء الاصطناعي، ظهرت تحديات جديدة تتطلب حلولاً مبتكرة. النماذج المعقدة تقدم قدرة أكبر دون الحاجة إلى زيادة كبيرة في التكاليف الحسابية، ولكن تبقى عملية تحسين المعايير الحسابية، وخاصة معدل التعلم، مرهقة للغاية عند العمل مع أحجام كبيرة من النماذج.

في سعيهم لتحقيق ذلك، قدم الباحثون إطارًا جديدًا لنقل معايير التعلم بكفاءة، يعتمد على أسلوب ثنائي المراحل. يتيح هذا الإطار تقدير معدلات التعلم المثلى لتدريب النماذج الكبيرة من خلال تحويلها بين عرض النموذج، مما يفسح المجال للانتقال إلى آفاق تدريب بمليارات التوكنات.

تبدأ العملية بتطوير طريقة جديدة تسمى Maximal Update Parameterization (µP)، والتي تعمل بالتوازي مع آلية Multi-head Latent Attention (MLA) والمُحسّن Muon. تم إثبات قدرة هذه الطريقة على نقل معدلات التعلم المثلى عبر النماذج ذات الأحجام المختلفة بنجاح.

ثم يتضمن الإطار انتقالًا على طول محور التوكن من خلال إنشاء قانون توسيعي تنبؤي، والذي يتم تطبيقه عبر الانحدار الخطي لاستنتاج القيم المثالية من نماذج صغيرة مخفضة الميزانية، حيث يتمكن الباحثون من extrapolating معدل التعلم المثالي إلى مجموعة واسعة من البيانات، تصل إلى 10 تريليونات توكنات.

النتيجة؟ يمكن تدريب النماذج الكبيرة بكفاءة أكبر دون الحاجة لإعادة تجريب المعلمات في كل مرة، مما يساهم في توفير الموارد وضمان نتائج مدروسة من خلال استخدام نماذج أصغر كمرجع.

مع استخدام هذه المنهجية، تمكن الباحثون من تدريب نموذجهم الأساسي الذي يحتوي على 155 مليار توكن، مما يظهر فعالية الاقتراح وأهميته الكبيرة في أبحاث الذكاء الاصطناعي.