تواجه نماذج الخبراء (MoE) من نوع نماذج اللغات الضخمة (LLMs) ثلاثة تحديات رئيسية؛ وهي عدم توازن الحمل والازدواجية في المعلمات وزيادة الحمل الناتج عن الاتصال. تكشف دراسة جديدة عن إطار عمل موحد يعتمد على تجميع الخبراء الديناميكي وتقنية ضغط هيكلية لمواجهة هذه التحديات بشكل متكامل.
تقنية جديدة تمزج بين طرق التجميع الديناميكية مع الإعداد الهيكلي للمعلمات، مما يحقق مستوى عالٍ من الاستقرار في استخدام الخبراء. يتطلب هذا الأسلوب إجراء تجميعٍ دوري للخبراء استنادًا إلى مقاييس فريدة للمعلمات وتطابق التفعيلات، مما يضمن تحقيق كفاءة في استخدام الموارد.
من حيث التميز، تعتبر هذه الطريقة واحدة من أولى الطرق التي تستفيد من قدرة تشفير المعاني الخاصة بالراوتر لإعادة تكوين هيكل النموذج ديناميكياً أثناء التدريب، مما يحقق مكاسب ملحوظة في الكفاءة. من خلال تفكيك الأوزان الخاصة بالخبراء إلى مصفوفة أساسية مشتركة ومحللات ذات رتبة منخفضة، يمكن تقليل عدد المعلمات بنسبة تصل إلى خمسة أضعاف لكل مجموعة مع الحفاظ على التخصص.
هذا الإطار يعزز من استراتيجية التوجيه الهرمي ثنائية المرحلة حيث يتم تعيين الرموز أولًا إلى مجموعة معينة، ثم إلى خبراء محددين داخل تلك المجموعة. مما يقلل بشكل كبير من مساحة البحث الخاصة بالتوجيه وحجم الاتصالات بين جميع الخبراء.
علاوة على ذلك، وضعت التقنية نظام دقة غير متجانسة حيث يتم تخزين الأسس المشتركة بدقة FP16 والعوامل المتبقية بدقة INT4، مما يحقق تخفيضًا في استهلاك الذاكرة إلى مستويات مماثلة للنماذج الكثيفة.
تم تقييم هذا الإطار على مجموعة بيانات GLUE وWikiText-103، ويظهر نتائج مدهشة: بجودة تنافس نماذج MoE القياسية مع تقليل إجمالي المعلمات بنسبة تقارب 80%، وزيادة الإنتاجية بنسبة تتراوح بين 10% إلى 20%، وتقليل تفاوت أحمال الخبراء بمعدل ثلاث مرات أكثر.
إن هذا العمل يوحي بأن إعادة تنظيم الهيكل تُعتبر خطوة ذكية نحو نماذج MoE LLMs قابلة للتوسع، وكفؤة، وتستهلك ذاكرة أقل. لمزيد من المعلومات ولتحميل الكود، يرجى زيارة الرابط [هنا].
تحطيم معضلة نماذج الخبراء: الابتكار في دمج وتقنية ضغط الهيكل
تمثل نماذج اللغات الضخمة (LLMs) مثالاً مذهلاً على الابتكار التكنولوجي، ولكنها تعاني من تحديات متزايدة. تقدم دراسة جديدة إطار عمل جديد لمواجهة هذه التحديات بشكل متكامل وفعال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
