في عالم تعلم الآلة، يعتمد أداء الاستدلال والتدريب بشكل كبير على كفاءة كيرنلات وحدة معالجة الرسوميات (GPU). بينما تقوم المحولات الحديثة مثل PyTorch Inductor بتوليد كيرنلات من التعليمات البرمجية ذات المستوى العالي، فإن الأداء في بعض الأحيان يكون أقل بكثير من الأنظمة التي كتبها خبراء. في هذا السياق، قدم الباحثون مفهومًا جديدًا يدعى KernelOPT، وهو نظام متعدد الوكلاء يهدف إلى تحسين كفاءة الكيرنلات بشكل شامل.
KernelOPT يعمل بطريقة مبتكرة حيث يعامل النماذج المجمعة ككيانات منظمة، مما يحافظ على استدعاءات المكتبات الخاصة بالبائعين مثل cuBLAS وcuDNN، ويركز بشكل حصري على تحسين الكيرنلات الفرعية المولدة بواسطة Triton. يعتمد هذا النظام على خمسة وكلاء ذكاء اصطناعي مدعومين بتقنيات النظير والملف الشخصي، مما يتيح تقييمًا دقيقًا لأداء النماذج.
إحدى الميزات الأساسية لنظام KernelOPT هي سلسلة التحقق الرباعية التي تتضمن التحقق الثابت، والتحقق من صحة النموذج باستخدام عدة بدايات، والتحقق من دقة البيانات، وأخيرًا تصفية الأداء التي تساعد في ضمان أن النموذج المعدل يلبي المعايير المطلوبة. في حال عدم اجتياز أي مرشح لجميع نقاط التحقق الأربعة، يحتفظ النظام بالنموذج الأساسي الذي تم تجميعه.
تم تقييم KernelOPT عبر 250 مشكلة من KernelBench، وحقق تحسينات مذهلة في السرعة بمتوسط جيوغرافي وصل إلى 1.40 مرة مقابل exttt{torch.compile} في المرحلة الأولى. هذا النجاح يفتح أفقًا جديدًا لتقديم حلول أكثر فعالية في عالم تعلم الآلة، ويشير إلى أهمية الاستفادة من الذكاء الاصطناعي في تحسين الأداء البرمجي.
KernelOPT: ثورة في تحسين كيرنلات وحدات معالجة الرسوميات بفضل الذكاء الاصطناعي
يتناول المقال مفهوم KernelOPT، وهو نظام مبتكر يعمل على تحسين أداء كيرنلات GPU باستخدام تقنيات الذكاء الاصطناعي. العملية ترتكز على معالجة هياكل النماذج المجمعة لتحسين الأداء إلى مستويات غير مسبوقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
