تحتل نماذج Mixture-of-Experts (MoE) مكانة مرموقة في عالم الذكاء الاصطناعي، ولكن مع زيادة عدد الخبراء إلى المئات، تبرز حاجة ملحة لتحسين كفاءة الذاكرة خلال التدريب الموزع. في هذا الإطار، قدم الباحثون تقنية جديدة تُعرف بـ RelayMoE، التي تهدف إلى تجاوز القيود التقليدية المتعلقة بكفاءة الذاكرة.

تعتمد تقنية RelayMoE على نموذج تنفيذ حلقي، حيث يتم حساب وزن الخبراء أو الرموز بشكل محلي أثناء تنقلها. مما يلغي الحاجة لبناء قوائم تخزين كبيرة لجميع الرموز المرسلة في خطوة واحدة، وهو ما يعتبر عائقاً شائعاً في الطرق التقليدية.

تتميز RelayMoE بإمكانية اختيار طرق التوجيه بين الخبراء والرموز بناءً على حجم الاتصالات، مما يسمح بتحسين الأداء العام. كما يدعم الهيكل الحلقي إعادة حساب كفاءة MoE أثناء التدريب العكسي، حيث يتم استغلال كل مرحلة لإعادة بناء المعلومات المهمة واستخدامها لحساب التدرجات، مما يقلل من استهلاك الذاكرة.

النتائج كانت مذهلة، حيث تمت اختبار تقنية RelayMoE على نماذج MoE التي تتراوح بين 30B و57B، محققة سرعة تصل إلى ضعف سرعة نموذج Megatron-LM في التجارب ذات الطبقة الواحدة. وخلال تدريب النموذج الكامل، ارتفعت الإنتاجية بنسبة تصل إلى 2.02 مرة، مع إمكانية زيادة طول تسلسل البيانات المدربة بمعدل يصل إلى 2.85 مرة.

هذا التطور يستحق التقدير، إذ يفتح آفاقاً جديدة في عالم تدريب النماذج الكبيرة، ويعزز القدرة على إنشاء نماذج أكثر تعقيداً ودقة. هل تفكرون في تأثير هذه التقنية على مستقبل الذكاء الاصطناعي؟ شاركونا بآرائكم وتجاربكم في التعليقات!