أصبح الحديث عن الذكاء الاصطناعي (AI) أكثر إثارة من أي وقت مضى، خاصة مع ظهور استراتيجيات جديدة تعمل على تحسين أداء نماذج اللغات الضخمة (Large Language Models). وفي هذا السياق، تقدم LOOM كاقتراح مبتكر لعلاج التحديات المرتبطة بالعمق المتكرر في نماذج مزج الخبراء (Mixture-of-Experts).
أظهرت الأبحاث السابقة أن استخدام تكرار التحولات (Transformers) يمكن أن يساعد في زيادة العمق الفعال للنماذج دون إضافة عدد كبير من المعلمات. لكن تبين أن الفوائد المرجوة ليست واضحة دائماً، خاصة في حالات المقارنات المتساوية (FLOPS-matched comparisons). فعلى الرغم من أن تكرار المحولات يمكن أن يعزز العمق، إلا أن العديد من الجولات الإضافية قد تؤدي إلى تدهور في الأداء.
يتمثل التحدي الأكبر في الاستقرار عند استخدام تعدد التكرارات، حيث تزداد متغيرات الحالة الخفية مع كل تكرار. وهذا يعني أن التحديثات المتبقية يمكن أن تتراكم وتتسبب في عدم استقرار النماذج. وعلاوة على ذلك، فإن مشاكل اختيار الخبراء تتسبب في أن يختار الرواتر (routers) نفس الخبراء مما يؤدي إلى تكرار الحسابات دون تقديم تنوع كافٍ.
من هنا، جاء الاقتراح المبتكر: LOOM. تعتمد LOOM على مبدأ واحد بسيط؛ يجب أن يساهم كل تكرار في حساب جديد مع ضمان استقرار حالة التكرار. ولهذا، تتم إدارة التحديثات المتبقية لتقليل نمو الفروق، بالإضافة إلى إعادة حقن إدخال البيانات في كل تكرار. كما تعمل على تنويع التكرارات من خلال استخدام رواتر مختلف في كل حلقة، واحتواء تكرار سابق يحمل النتائج المبكرة للعمليات.
تشير التجارب التي أجريت على نماذج تتراوح من 100M إلى 1.7B إلى أن LOOM يمكن أن تحقق أداءً مستقراً يصل إلى تسع إلى اثنتي عشرة تكراراً. تحت ظروف مقاربة في حسابات FLOP، يتفوق النموذج الذي حجمه 700M عند استخدام خمس حلقات تحسين، حيث تم تقليل درجة التعقيد من 18.36 إلى 16.54، وتحسين دقة العينة الصفرية المتوسطة من 38.84% إلى 39.53%. بدون مطابقة FLOP، يصل نموذج 1.7B المدرب على 60B رمز إلى أعلى أداء عند تسع حلقات، حيث انخفضت درجة التعقيد من 9.62 إلى 7.77، وتحسنت دقة العينة الصفرية المتوسطة من 42.4% إلى 47.7%.
لمزيد من التفاصيل، يمكنكم زيارة الرابط: [https://github.com/hed-ucas/LOOM] ويُمكنكم بالتأكيد استكشاف المزيد عن هذه التطورات الرائعة.
ما رأيكم في هذه الاستراتيجية الجديدة؟ شاركونا آراءكم في التعليقات!
ثورة جديدة في الذكاء الاصطناعي: استراتيجية LOOM لتحسين الأداء في نماذج مزج الخبراء!
تعد LOOM اقتراحاً مبتكراً لتحسين نماذج مزج الخبراء (Mixture-of-Experts) من خلال تقديم حل لمشكلات العمق المتكرر. مع نتائج تجريبية مشوقة، تُظهر LOOM إمكانات هائلة لدفع حدود النماذج اللغوية العملاقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
