في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الضخمة (Large Language Models) من التقنيات الأساسية التي تعيد تشكيل التفاعل مع البيانات. ومع ذلك، فإن الطريقة التقليدية في تنفيذ طبقات هذه النماذج تسير بشكل تسلسلي، مما قد يؤدي إلى أداء محدود في بعض الحالات. هنا يأتي الابتكار الجديد: 'توجيه طبقات المحولات باستخدام سلسلة ماركوف' أو ما يعرف اختصارًا بـ'MACRO'.
يستند 'MACRO' إلى فكرة توجيه النموذج بطرق ديناميكية، حيث يبحث عن مسارات تنفيذ مختلفة عبر الطبقات، مما يتيح تكرار الطبقات وتجاوزها أو القيام بتحركات متنوعة لتحسين الأداء. تكمن مشكلة الطرق الحالية في أنها تتطلب عادة تحديث أوزان النموذج، مما يزيد من تكلفة الاختبارات، أو تحتاج إلى تواجد تسميات دقيقة خلال عملية الاستدلال.
نقدم في هذه الدراسة إطار 'MACRO'، الذي يتميز بتعلم مسارات محددة لمهام معينة عبر هياكل نماذج اللغة الضخمة، دون تعديل المعلمات الأساسية. يعتمد هذا النموذج على سياسة ماركوف السياقية التي تتعلق بمؤشرات الطبقات، وميزانيات الحساب، والانزياحات الاتجاهية، وسياقات المشغلين.
تتجسد فائدة 'MACRO' في تحسين دقة النماذج المستخدمة، حيث تم تحقيق متوسط زيادة في الدقة بنسبة +5.0% مقارنة بالأساليب التي لم تتبع توجيهًا. وتظهر النتائج أيضًا تحسنًا كبيرًا يصل إلى +7.2% مقارنة بأفضل طريقة توجيه ديناميكي سابقة تعرف باسم 'Dr. LLM'، مما يقلل من وقت البحث بشكل ملحوظ (من 14.8 إلى 1.6 ساعة).
أخيرًا، يمكنك زيارة رابط كود MACRO في GitHub لاستكشاف المزيد عن هذا الابتكار المثير وتجربته بنفسك!
ابتكار ثوري: توجيه طبقات المحولات باستخدام سلسلة ماركوف لتحسين الأداء في نماذج اللغة الضخمة!
تقدم الدراسة الجديدة إطار عمل 'MACRO' الذي يسهم في تحسين أداء نماذج اللغة الضخمة (LLMs) من خلال توجيه طبقات المحولات دون الحاجة لتحديث المعلمات الأساسية. النتائج أشارت إلى زيادة دقيقة تصل لـ5% في الدقة مقارنةً بالأساليب التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
