في مجال الذكاء الاصطناعي، تسلط الأبحاث الحديثة الضوء على تقنيات جديدة في نماذج المزج المتخصص (Mixture-of-Experts أو MoE)، حيث تعتمد هذه النماذج على توجيه كل رمز إلى عدد قليل من الخبراء وإعادة ضبط احتمالات التوجيه. ولعل أكثر ما يثير الانتباه هو كيفية عمل هذه النماذج في السيطرة على مخرجات الخبراء دون الحاجة لإجراء تدريبات إضافية.
تظهر الدراسات الأخيرة أنه من خلال تجزئة الخبراء إلى مجموعات وتحسين عمليات النمذجة، يمكن تقليل عدد الخبراء الموجهين بنجاح. على سبيل المثال، تبيّن أن تقليل عدد الخبراء من 8 إلى 4 سيؤدي إلى انخفاض قدره 4.65 نقطة في دقة الاختبار القياسي، لكن باستخدام مرجعية مزدوجة، يتراجع هذا الانخفاض ليصل إلى 0.35 نقطة فقط.
عند الدراسة على نموذج Qwen3.5-397B-A17B الأكبر، كانت النتائج مشجعة بشكل يشير إلى أهمية الاحتفاظ بكتلة مرجعية مناسبة حيث يصبح إزالة إعادة التقييم ضارًا تمامًا. وتظهر التحليلات أيضًا أن هوية الخبراء قد تكون أكثر أهمية بكثير من وزنهم، مما يطرح تساؤلات جديدة حول كيفية توجيه بيانات التدريب وضبط إعدادات الضغط بدون الاعتماد على نصوص غير مصنفة.
هذا التطور يُعد خطوة هامة نحو تحسين الأداء وكفاءة استخدام الموارد في الذكاء الاصطناعي، مما يفتح آفاق جديدة لابتكارات مستقبلية مثيرة.
واكب التطور: تقنيات جديدة لضبط أداء نماذج الخبراء المُتخصصة بدون تدريب!
تقدم الأبحاث الحديثة في نماذج المزج المتخصص (Mixture-of-Experts) استراتيجيات مبتكرة لضبط إنتاجية الخبراء دون الحاجة لتدريب إضافي. احصل على التفاصيل حول هذا التطور المتقدم الذي يُعيد تعريف كيفية استغلال الموارد في الذكاء الاصطناعي!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
