في عالم الذكاء الاصطناعي، يُعتبر تدريب نماذج المزيج من الخبراء (Mixture of Experts - MoE) من التطورات البارزة في تحسين أداء معالجة اللغة الطبيعية. إلا أن هذا التقدم جلب معه تحديات جديدة خاصة في مجال إدارة الذاكرة. في دراسة جديدة تظهر نتائجها المثيرة، تم تسليط الضوء على 'SkewAdam'، مُحسّن مبتكر صُمم لتوزيع حالة المُحسّن بطريقة تقلل من استخدام الذاكرة بشكل فعال.
يتضح من البحث أن حالة المُحسّن تمثل أكبر عنصر في ميزانية الذاكرة خلال تدريب نماذج MoE. مثلاً، في نموذج لغوي يحتوي على 6.78 مليار معلمة، يحتاج مُحسّن AdamW إلى 50.6 جيجابايت من الذاكرة لتحديث 12.6 جيجابايت من الأوزان. ومن خلال تحليل سلوك نماذج MoE، توصل العلماء إلى أن حالات المُحسّن يجب أن تختلف بحسب طبيعة أقسام النموذج: العمود الفقري الكثيف، الخبراء، والموزع. عند استخدام SkewAdam، تم تخفيض الذاكرة اللازمة لتصل إلى 1.29 جيجابايت، ما يمثل 2.6% من حجم AdamW.
بالمقارنة، حقق SkewAdam أداءً مذهلاً حيث وصلت معايير الدقة إلى 108.4 بينما كان AdamW 126.8 وMuon 120.2، مما يبرز الأهمية الكبيرة لتوزيع الموارد بشكل مدروس. ويرى الباحثون أن الطريقة التي يتم بها توزيع حالة المُحسّن قد تكون بنفس أهمية الحجم الاجتماعي لذاك المُحسّن، مما يقدم رؤى جديدة حول كيفية تحسين عمليات التدريب.
بهذه الدراسة، يتم تسليط الضوء على الظواهر المثيرة والمبتكرة في مجال الذكاء الاصطناعي. يعتبر هذا الإنجاز خطوة هامة نحو تحسين الكفاءة في استخدام الذاكرة وتحسين أداء نماذج الذكاء الاصطناعي.
استدامة الذاكرة في تدريب نماذج الخبراء: اكتشاف جديد حول حالة المُحسّن!
اكتشف بحث جديد تأثير توزيع حالة المُحسّن في تدريب نماذج المزيج من الخبراء (MoE) وكيف يمكن أن يقلل من استخدام الذاكرة بشكل كبير. نتائج مثيرة تشير إلى أن المكان الذي تعيش فيه حالة المُحسّن قد يكون بنفس أهمية كميتها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
