في عالم الذكاء الاصطناعي، تتزايد أهمية تحسين النماذج بهدف تقليل التكلفة وزيادة الكفاءة. تعتبر النماذج المتعددة الخبراء (Mixture-of-Experts) إحدى الابتكارات التي تسعى لتفكيك إجمالي المعلمات عن الحسابات لكل توكن، ولكن تظل الحاجة قائمة لتخزين كل خبير.

دراسة حديثة تم نشرها على arXiv تعرضت لهذه المسألة، حيث أثبتت أن تقليم (pruning) الخبراء الذين تظهر عليهم أقل التغييرات في حساسية الموجه (router-norm) خلال التكييف يمكن أن يحافظ على دقة النموذج وذلك من خلال الاعتماد على التكيف الخفيف.

تتضمن الطريقة الجديدة تكييفاً قصيراً باستخدام موصل فعال من حيث المعلمات، وتصنيف الخبراء وفقاً للتغييرات التي تحدث في حساسية الموجه. النتيجة المثيرة الآن هي أنه يمكن تقليم الأقل تغييراً من الخبراء دفعة واحدة، مما يؤدي إلى تقليل حجم النموذج.

طبقاً للدراسة، فإن استخدام نموذج Mixtral-8×7B-Instruct أثبت نجاحاً مبهراً؛ حيث تمكن النظام من تطوير دقة تصل إلى 28.76% مع تقليل متطلبات الذاكرة بنسبة تصل إلى 49% وتقليل زمن الاستجابة لكل توكن بنسبة 37%.

كما تم تحقيق نتائج مؤثرة مع نموذج IA3، حيث تتطابق النتائج مع تكييف الموجه المباشر، بينما أسفرت العقد غير المقيدة عن تدهور في الإشارة.

باختصار، تُظهر هذه الدراسة أن حساسية الموجه تحت التكييف الخفيف تجعل عملية تقليم الخبراء المدعومة بالأدلة عملية قابلة للتطبيق على نطاق واسع، مما يمثل ثورة في كيفية التعامل مع النماذج المتعددة الخبراء.

ما رأيكم في هذه التطورات المثيرة؟ شاركونا بأفكاركم في التعليقات!