في عالم الذكاء الاصطناعي، يُعتبر تطوير نماذج تعلم اللغات (Language Models) جزءًا حيويًا من التقدم التقني. فالنماذج متعددة الوسائط الكبيرة (Multimodal Large Language Models) تم تصميمها لدعم مجموعة واسعة من القدرات عبر مجالات متنوعة. ومن بين الأساليب الجديدة التي تم طرحها في هذا السياق، تبرز طريقة التقطير المتعددة المعلمين (Multi-Teacher On-Policy Distillation - MOPD) كإطار فعال لجمع الخبرات المتخصصة في نموذج واحد.
ومع ذلك، خلال تدريب MOPD، لوحظ أن الطلاب يبتعدون تدريجياً عن نموذجهم الابتدائي، مما يؤدي إلى تدهور القدرات العامة حيث تزداد هذه المسافة، وهو ما يعرف بالتداخل في القدرة (Capability Interference). ولعلاج هذه المسألة، يتم تقيد الطلاب نحو نموذجهم الابتدائي، لكن هذا يؤدي إلى قمع اكتساب الخبرات المتخصصة.
لحل هذه التحديات، تم تقديم تقنية Slow-Fast Multi-Teacher On-Policy Distillation (SF-MOPD)، التي تجمع بين نموذج سريع، يتم تحديثه مباشرة من قبل كل معلم، ونموذج بطيء يستند إلى متوسط متحرك أسي للطالب. يعمل النموذج البطيء على استيعاب إشارة التعلم ببطء، مما يوفر مرجعًا متحركًا للقدرات، ويوحد بين الأساس العام والخبرات المتخصصة.
تعتمد SF-MOPD على حساب تحديثات المعلم في فضاء الاحتمالات اللوجستية، حيث يتم إزالة فقط الجزء الذي دفع النموذج السريع بعيدًا عن النموذج البطيء، بينما تحتفظ بالمكونات المتوافقة والعمودية.
أظهرت التجارب عبر نماذج متعددة أن SF-MOPD تقلل من تداخل القدرة، وتعزز القدرات المتخصصة المتعددة الوسائط، كما تقلل المتوسط العام للانخفاض في مؤشرات القدرة العامة، متفوقةً باستمرار على MOPD التقليدية. وهذا يعكس خطوات جديدة نحو تحسين أداء نماذج الذكاء الاصطناعي بشكل عام.
تقنية مبتكرة: تعزيز الاستفادة من نماذج التعلم عبر طريقة التقطير المتعددة المعلمين
تقدم تقنية Slow-Fast Multi-Teacher On-Policy Distillation (SF-MOPD) أسلوبًا متطورًا للحفاظ على القدرات العامة للنماذج اللغوية العملاقة. تعتمد هذه الطريقة على دمج نماذج سريعة وبطيئة لتعزيز التخصص وتحسين الكفاءة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
