في عالم تعلم الآلة، يعتمد أداء الاستدلال والتدريب بشكل كبير على كفاءة كيرنلات وحدة معالجة الرسوميات (GPU). بينما تقوم المحولات الحديثة مثل PyTorch Inductor بتوليد كيرنلات من التعليمات البرمجية ذات المستوى العالي، فإن الأداء في بعض الأحيان يكون أقل بكثير من الأنظمة التي كتبها خبراء. في هذا السياق، قدم الباحثون مفهومًا جديدًا يدعى KernelOPT، وهو نظام متعدد الوكلاء يهدف إلى تحسين كفاءة الكيرنلات بشكل شامل.

KernelOPT يعمل بطريقة مبتكرة حيث يعامل النماذج المجمعة ككيانات منظمة، مما يحافظ على استدعاءات المكتبات الخاصة بالبائعين مثل cuBLAS وcuDNN، ويركز بشكل حصري على تحسين الكيرنلات الفرعية المولدة بواسطة Triton. يعتمد هذا النظام على خمسة وكلاء ذكاء اصطناعي مدعومين بتقنيات النظير والملف الشخصي، مما يتيح تقييمًا دقيقًا لأداء النماذج.

إحدى الميزات الأساسية لنظام KernelOPT هي سلسلة التحقق الرباعية التي تتضمن التحقق الثابت، والتحقق من صحة النموذج باستخدام عدة بدايات، والتحقق من دقة البيانات، وأخيرًا تصفية الأداء التي تساعد في ضمان أن النموذج المعدل يلبي المعايير المطلوبة. في حال عدم اجتياز أي مرشح لجميع نقاط التحقق الأربعة، يحتفظ النظام بالنموذج الأساسي الذي تم تجميعه.

تم تقييم KernelOPT عبر 250 مشكلة من KernelBench، وحقق تحسينات مذهلة في السرعة بمتوسط جيوغرافي وصل إلى 1.40 مرة مقابل exttt{torch.compile} في المرحلة الأولى. هذا النجاح يفتح أفقًا جديدًا لتقديم حلول أكثر فعالية في عالم تعلم الآلة، ويشير إلى أهمية الاستفادة من الذكاء الاصطناعي في تحسين الأداء البرمجي.