في عالم الذكاء الاصطناعي المتسارع، تسعى نماذج Mixture-of-Experts (MoE) إلى تحسين كفاءة النموذج الكبير من خلال تفعيل غير مكثف. ومع ذلك، يظل أهمية كل طبقة من الطبقات موضع تساؤل، وخاصة عند التعامل مع ضغط النماذج.
تقدم دراسة جديدة تحليلًا شاملًا لحساسية الطبقات في نموذج Qwen3.6-35B-A3B، الذي يتكون من 40 طبقة MoE مع 256 خبيرًا لكل طبقة. تم استخدام التقنيات القائمة على وزن الخبير لتحليل الأداء على معيار XLCoST، والذي يركز على ترجمات الشيفرات متعددة اللغات.
أحد الاكتشافات الرئيسية هو أن حساسية الطبقات ترتبط بقوة بعمق الطبقة؛ حيث تظهر الطبقات الأولى (0-9) والطبقات الوسيطة (10-29) حساسية عالية تجاه تغيير الخبراء، بينما تتحمل الطبقات المتأخرة (30-39)، وخاصة الطبقات الأخيرة (35-39)، التغييرات العنيفة للخبراء ذوي الأوزان المنخفضة. على سبيل المثال، أدى استخدام سياسة التصفية على الطبقات الأخيرة إلى الحفاظ على 249-255 من 300 مخرجات جيدة، بينما فقدت الطبقات الأخرى كفاءة أكبر.
يغطي البحث أيضًا خفض عرض توجيه top-k من 8 إلى 6 خبراء نشطين لكل رمز، مما يحقق تخفيضًا كبيرًا في الوقت المستغرق دون فقدان الجودة.
هذه النتائج ليست مجرد تحليل، بل هي أيضًا أساس لتطوير تقنيات جديدة في مجال الوزن الفيزيائي، تصنيف الخبراء بناءً على التفعيل، واسترجاع النماذج المدربة.
ما هو رأيكم في هذه التطورات المثيرة في عالم الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.
تحليل حساسية الطبقات في نماذج Mixture-of-Experts: ثورة في الذكاء الاصطناعي!
يوفر البحث الجديد Insights هامة حول نماذج Mixture-of-Experts (MoE) حيث يُظهر تحليل الحساسية اختلافًا في تأثير الطبقات حسب العمق. هذا سيفتح آفاقًا جديدة لتحسين كفاءة النماذج الكبيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
