في عالم الذكاء الاصطناعي، يعتبر النمو المستمر في سعة النماذج والتكلفة أمراً حيوياً للتطور. يأتي هنا مفهوم Mixture of Reused Experts (MoRE)، المعمارية التي تتميز بقدرتها على الفصل بين سعة النموذج وتكلفة المعالجة، مما يقلل من الأعباء الذاكرية التي تظهر عند زيادة عدد الخبراء.
تقنيات الـ Recurrent Transformers تعتبر أيضاً مثالاً على ذلك، حيث تحقق فعالية في استخدام المعلمات من خلال إعادة استخدام أوزان الطبقات. لكن، لطالما كانت هذه التقنيات تعاني من نقص القدرة التنافسية في نماذج اللغات.
تقدم MoRE حلاً مبتكراً من خلال مشاركة برك الخبراء عبر مجموعات من الطبقات المجاورة. يحتفظ كل طبقة بموجهه الخاص، لكنه يختار من مجموعة مشتركة أكبر، مما يوسع تنوع مجموعات التوجيه دون إضافة معلمات جديدة.
لتمكين الخبراء المشتركين من التمييز بين الطبقات، تم تقديم مجموعة خفيفة من التضمينات القابلة للتعلم التي تشكل مدخلات كل طبقة قبل التوجيه.
أظهرت التجارب عبر ثلاثة مقاييس نماذج (114M-1.15B معلمات) أن MoRE تحقق باستمرار انخفاضاً في الارتباك (perplexity) وأداءً قوياً في مهام معالجة البيانات مقارنة مع النماذج التقليدية، مع تعديلات بسيطة على تطبيقات MoE القائمة. هذا يجعل MoRE حلاً محوريًا للمسائل المعقدة في معالجة اللغة الطبيعية.
ثورة في نماذج الذكاء الاصطناعي: MoRE توازن بين السعة والتكلفة!
تقدم MoRE نوعاً جديداً من المعمارية الذكية تجمع بين كفاءة الاستخدام والقدرة العالية على معالجة اللغات. يضمن هذا النوع تقليل التعقيد مع تعزيز الأداء في نماذج الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# Mixture of Reused Experts# MoRE# معالجة اللغة الطبيعية# Recurrent Transformers# نموذج الذكاء الاصطناعي
جاري تحميل التفاعلات...
