في عالم الذكاء الاصطناعي، تعد نماذج خليط الخبراء (Mixture-of-Experts) من الأدوات البارزة التي تتيح توسعة سعة النموذج دون الحاجة المتزايدة لحسابات التدريب. ومع ذلك، فإن زيادة التباين غالباً ما تجعل نقل المعلمات بشكل موثوق أمراً معقداً.

تبرز دراسة حديثة كيف أن القوانين التقليدية لمقياس المعلمات غير كافية للنماذج ذات التباين الشديد، حيث إن معدل التعلم الأمثل وحجم الدفعة يتغيران تبعاً لنسبة التفعيل. ولتسليط الضوء على هذه العلاقات، تم إجراء 1,800 عملية تدريب مسبق عبر ستة مقاييس مختلفة من المعلمات المفعلة، والتي تضمنت نماذج تصل إلى 6 مليار معلمة غير مخصصة.

أبرزت النتائج أنه عند ثبات التباين، يتبع حجم الدفعة الأمثل علاقة تعتمد على قانون القوة مع عدد الرموز التدريبية، في حين أن معدل التعلم الأمثل يتناسب مع حساب التدريب ويظل ثابتاً بالنسبة للتوزيع بين حجم النموذج والبيانات.

هذه الملاحظات أدت إلى تطوير قوانين موحدة لمقياس المعلمات، والتي يمكن أن تتنقل عبر مستويات التباين في نماذج خليط الخبراء. كما أظهرت تقييمات واسعة النطاق أن هذا النموذج المتكامل يتجاوز البدائل الأخرى.

تم التحقق من دقة المعلمات المتوقعة بالنظر إلى نموذج خليط خبراء بشدة كبيرة مع 12 مليار معلمة و1/64 فقط من الخبراء المفعّلين، حيث تظل القيم المتوقعة قريبة من المثالية الملاحظة.

تُعزز التجارب الإضافية الفهم حول الفرق بين الكثافة المفعّلة وإجمالي عدد الخبراء، مما يمهد الطريق لمزيد من الابتكارات في هذا المجال.