في عالم الذكاء الاصطناعي، يعتبر النمو المستمر في سعة النماذج والتكلفة أمراً حيوياً للتطور. يأتي هنا مفهوم Mixture of Reused Experts (MoREالمعمارية التي تتميز بقدرتها على الفصل بين سعة النموذج وتكلفة المعالجة، مما يقلل من الأعباء الذاكرية التي تظهر عند زيادة عدد الخبراء.

تقنيات الـ Recurrent Transformers تعتبر أيضاً مثالاً على ذلك، حيث تحقق فعالية في استخدام المعلمات من خلال إعادة استخدام أوزان الطبقات. لكن، لطالما كانت هذه التقنيات تعاني من نقص القدرة التنافسية في نماذج اللغات.

تقدم MoRE حلاً مبتكراً من خلال مشاركة برك الخبراء عبر مجموعات من الطبقات المجاورة. يحتفظ كل طبقة بموجهه الخاص، لكنه يختار من مجموعة مشتركة أكبر، مما يوسع تنوع مجموعات التوجيه دون إضافة معلمات جديدة.

لتمكين الخبراء المشتركين من التمييز بين الطبقات، تم تقديم مجموعة خفيفة من التضمينات القابلة للتعلم التي تشكل مدخلات كل طبقة قبل التوجيه.

أظهرت التجارب عبر ثلاثة مقاييس نماذج (114M-1.15B معلمات) أن MoRE تحقق باستمرار انخفاضاً في الارتباك (perplexity) وأداءً قوياً في مهام معالجة البيانات مقارنة مع النماذج التقليدية، مع تعديلات بسيطة على تطبيقات MoE القائمة. هذا يجعل MoRE حلاً محوريًا للمسائل المعقدة في معالجة اللغة الطبيعية.