تُعَد نماذج الخبراء (Mixture-of-Experts, MoE) من التقنيات المتقدمة في الذكاء الاصطناعي، حيث تسمح بتوسيع نطاق نماذج اللغات حتى تصل إلى تريليونات من المعلمات. لكن، كانت هناك تحديات كبيرة في نشر هذه النماذج بسبب القيود المتعلقة بالذاكرة وسرعة نقل البيانات. وقد برزت الحلول الحديثة مثل نوى تنسور المتناثرة (Sparse Tensor Cores, SpTCs) التي تقلل من تخزين الأوزان وتزيد من الإنتاجية، ولكن الاستفادة من هذه التكنولوجيا في نماذج الخبراء كانت صعبة بسبب مخاوف فقدان جودة النموذج ونقص في الدوال الأساسية المطلوبة.
في خطوة ثورية، قدم فريق من الباحثين إطار عمل يجمع بين البرمجة والتصميم الهاردوير لزيادة كفاءة أداء نماذج الخبراء. حيث يقوم هذا النظام الجديد بضغط أوزان الخبراء إلى تمثيلات متفرقة منخفضة الدقة، ويُسرع عملية تنفيذها على نوى تنسور المتناثرة. ينتج عن هذا توحيد الأساليب الخوارزمية مما يُعزز دقة المعالجة عند إجراء تحسين مشترك للأوزان المُقاسة.
نتائج هذه الأبحاث تشير إلى أن النظام الجديد يعمل على تحسين دقة نماذج الخبراء حتى 4.35% مع الحفاظ على 96.09% من أداء النموذج الأصلي. وعندما تم اختبار هذا الإطار الجديد على وحدات معالجة الرسوميات من NVIDIA B200، تبين أن الكود الخاص بهم يتفوق على المقاييس الأخرى بنسبة تصل إلى 1.65 مرة، بالإضافة إلى زيادة الإنتاجية بنسبة 1.18 مرة وتقليل زمن الاستجابة حتى 4.03 مرة.
تؤكد هذه النتائج أن تصميم الهاردوير والبرمجيات المتكامل يمثل مسارًا عمليًا نحو نشر نماذج الخبراء بكفاءة وقابلية للتوسع بشكل فعال.
إطلاق إطار عمل مبتكر لزيادة كفاءة نماذج الخبراء بنسبة 4.35%!
تمكن الباحثون من تطوير إطار عمل يجمع بين التصميم البرمجي والهاردوير لتحسين أداء نماذج الخبراء المتقدمة. النتائج تشير إلى تحسين دقة النماذج بنسبة تصل إلى 4.35% مع الحفاظ على أداء النموذج الأصلي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
