يواجه الذكاء الاصطناعي تحديات كبيرة عندما يتعلق الأمر بحركة البيانات في مراكز البيانات، خصوصاً مع استنتاجات النماذج اللغوية الكبيرة (Large Language Models) المتفرقة. يُظهر البحث الجديد أهمية تصميم نظام حركة بيانات ذكي يعرف بالعلاقات الطوبولوجية بين وحدات معالجة الرسومات (GPU).
عندما تعمل مراحل التحميل والقراءة بشكل منفصل، خاصة مع نماذج كبيرة تصل إلى 70 مليار متغير، يتطلب الأمر نقل ذاكرة التخزين المؤقت (KV cache) بطريقة فعالة لتجنب التأخير في الأداء. تشير الأبحاث إلى أنه مع الطلب المتزايد على عرض النطاق الترددي، يمكن أن يصل حجم البيانات المنقولة إلى 2.6 جيجابايت لكل طلب، مما يشكل عبئًا زائدًا على الأنظمة الحالية.
تتبع تقنيات مثل DistServe وSplitwise وMooncake معايير محدودة تعتمد على نقل البيانات الثابت، مما يؤدي إلى تجاهل الفروقات الكبيرة في سعة النطاق الترددي بناءً على العلاقات الفيزيائية بين وحدات المعالجة. تكشف الأبحاث الجديدة عن ابتكار آلية تنظيم نقل بيانات تتفهم التسلسل الهرمي للاتصال في بداية العمليات وتختار الطريقة المثلى لكل نقل.
تسعى الحلول المطورة إلى تحقيق ثلاثة أهداف رئيسية:
1. نقل البيانات بطريقة متسلسلة تُخفف التأخير بنسبة تصل إلى 85% من خلال دمج النقل مع العمليات الاستباقية.
2. تحسين استخدام بنية اتصالات NVLink في نماذج Mixture-of-Experts لضمان عدم فواقد البيانات.
3. استغلال تقنيات CXL 3.0 لدعم الذاكرة كوسيلة تخزين مشتركة بسعة أكبر مقارنة بأساليب NVMe التقليدية.
تتطلب التقييمات الكاملة للمنظومات المبتكرة استخدام مجموعات متعددة العقد مع اتصالات متنوعة، بالإضافة إلى أجهزة CXL 3.0 غير المتاحة بعد في بيئات السحاب GPU. ومع ذلك، تُظهر النماذج التحليلية مقدار التحسين المتوقع في جودة حركة البيانات، والتي قد تصل إلى 18 ضعفًا في تقليل زمن النقل عند مقارنتها بالأنظمة القديمة.
تحسين حركة البيانات في الذكاء الاصطناعي بواسطة نقل ذكي: ثورة في معالجة استنتاجات GPU
تقدم تقنية جديدة لحركة البيانات في استنتاجات الـ GPU المتفرقة، حيث تقدم نماذج تحليلية تضمن خفض زمن النقل بنسبة تصل إلى 18 ضعفًا. هذه التقنية تبشر بعصر جديد من الكفاءة في مراكز البيانات المعتمدة على الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
