في خطوة جريئة نحو تعزيز أداء نماذج التحويل، تم تقديم LayerRoute، أسلوب جديد يهدف إلى تحسين التخطي الذكي للطبقات في نماذج اللغة الكبيرة مثل Qwen2.5-0.5B-Instruct. يعتمد هذا النظام المبتكر على توجيه الطبقات الصارم، الذي تم تدريبه باستخدام تقدير مباشر، بالإضافة إلى تحسين LoRA (Low-Rank Adaptation).
يُعزز LayerRoute كل من الكتل الـ 24 في النموذج من خلال مختص بالغ الإيجاز يقوم بالتوجيه لكل طبقة، مع إضافة قواطع LoRA صغيرة بمعدل يدعم الوصول إلى 1.08 مليون ثابت. ومن خلال تدريبها بشكل متزامن، تم التوصل إلى أن LayerRoute يمكنه تحقيق نفس هيكل نمط التخطي عبر 10 جولات تدريب مستقلة، مما يُظهر موثوقية ملحوظة في الأداء.
من المثير للاهتمام أن LayerRoute تحقق زيادة في سرعة التنفيذ تتراوح بين 1.02x إلى 1.06x، مع متوسط 1.04x. وبالرغم من التغييرات، تظل الجودة محفوظة أو محسنة في جميع التكوينات المختبرة. هذا يعني أن التكيف مع LoRA يؤدي إلى تحسين استجابة النموذج بشكل ملحوظ في كل الحالات.
ليس ذلك فحسب، بل تم التحقق من أن قرارات التوجيه تؤثر على النتائج الفعلية في نسبة تصل إلى 100%؛ مما يدل على وجود توجيه فعلي يرتبط بمدخلات النموذج بدلاً من نمط تقليم ثابت.
لا يستغرق تدريب LayerRoute أكثر من 7 دقائق على وحدة معالجة الرسومات A100 واحدة، ويضيف القليل من العبء الإضافي بعد اتخاذ قرار التوجيه. يُظهر هذا العمل منهجية دقيقة لإعادة الإنتاج، بما في ذلك تحقيق تشخيصي منهجي لمحددات قرارات التوجيه لكل مدخل.
هذه التطورات الواعدة قد تُحدث فارقًا كبيرًا في كيفية تعامل نماذج اللغة الكبيرة (LLMs) مع البيانات وتحقيق الكفاءة المطلوبة في بيئات العمل.
LayerRoute: ثورة جديدة في تحسين كفاءة نماذج اللغة الكبيرة من خلال تخطي الطبقات
تمكن LayerRoute من تحقيق تخطي ذكي للطبقات في نماذج التحويل مع الحفاظ على جودة الأداء، مما يعزز كفاءة استدلال نماذج اللغة الكبيرة بشكل ملحوظ. التقرير يعرض آلية جديدة تجمع بين التوجيه الصارم وضبط LoRA المتقارب.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
