في عالم يتسارع فيه التنوع والقدرة على الذكاء الاصطناعي، يبرز نموذج Instella-MoE ليكون أحد أحدث الإنجازات في مجال نماذج اللغات. حيث يعبر هذا النموذج عن تطوير شامل تم تدريبه من الصفر باستخدام معالجات AMD Instinct MI300X وMI325X.
تم تصميم Instella-MoE كنموذج مزيج من الخبراء (Mixture-of-Experts) بكل جدارة وبعدد معلمات يصل إلى 16 مليار، مع 2.8 مليار معلمة نشطة لكل توكن. هذا المزيج الذكي يجمع بين تفعيل نادر لتصميم MoE وابتكارات معمارية على مستوى النظام، بما في ذلك ميزة Gated Multi-head Latent Attention (Gated MLA) والتواصل عبر FarSkip-Collective.
اعتمدت عملية التطوير على سلسلة من المراحل تشمل التدريب الأولي، والتدريب الوسطى، وتمديد السياق الطويل، والتدريب الدقيق بإشراف مع تحسين مباشر للتفضيلات، إضافة إلى التعلم المعزز باستخدام Multi-Teacher On-Policy Distillation. هذا النموذج يبدو واعداً بشكل خاص، حيث حقق متوسط نقاط 76.7 في المعايير القياسية للتدريب الابتدائي، متفوقاً على نماذج سابقة مثل OLMo-3-7B وSmolLM3-3B.
بعد الانتهاء من التدريب، سجل نموذج Think نقطة متوسطة تبلغ 73.2 عبر أنماط متعددة تشمل الاتباع للتوجيه، المنطق، الرياضيات، البرمجة، والدردشة. كما تفوق Instella-MoE على النماذج الأخرى التي تتمتع بعدد معلمات نشطة مشابه أو أكبر.
لضمان الأبحاث الشفافة والقابلة للتكرار، قام المطورون بإطلاق النموذج بشكل كامل، بما في ذلك الأوزان والتكوينات والتدريب، مما يضع Instella-MoE كقاعدة قوية لنماذج MoE ذات الأداء العالي.
إلى أي مدى تتوقعون أن يؤثر Instella-MoE على بحوث الذكاء الاصطناعي؟ دعونا نسمع آراءكم في التعليقات!
نموذج Instella-MoE: ثورة في نماذج اللغات مع 16 مليار معلمة!
يكشف تقرير Instella-MoE عن إنشاء نموذج لغوي متكامل يضم 16 مليار معلمة، يأتي مع الابتكارات المعمارية الحديثة لتدريب فعال. هذا النموذج يعدّ قفزة نوعية في عالم الذكاء الاصطناعي، مما يمنح الباحثين أدوات قوية لأبحاثهم.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
