في عالم متسارع يعتمد بشكل متزايد على الذكاء الاصطناعي، تمثل الأداة الجديدة Kernel Forge ثورة حقيقية في كيفية تحسين شفرات المعالجة على وحدات المعالجة الرسومية (GPUs). تعتمد الأداة على نماذج اللغة الكبيرة (LLMs) لتوليد وتحسين شفرات CUDA بسهولة وكفاءة.

تُستخدم نماذج التعلم الآلي اليوم في معظم البرمجيات، ولكن معظم وقت تشغيلها يتم قضاؤه في عدد محدود من العمليات الحسابية الأساسية مثل ضرب المصفوفات والتفتيت والتطبيع. تمثل هذه العمليات الفرصة المثالية لتقليل التأخير والتكاليف. ولكن تحسين هذه العمليات كان يتطلب تقليديًا مهندسين مختصين لكتابة الشفرات على مستوى منخفض.

لكن مع ظهور Kernel Forge، تغيرت اللعبة. يمكن الآن للأنظمة المدعومة من قبل LLMs توليد وتحسين الشفرات بكفاءة عالية ودون الحاجة لمجهود بشري كبير. ومع ذلك، فإن الأدوات الحالية تعاني من بعض القيود مثل اختبار الشفرات المولدة بشكل عشوائي، ووجود شفرات CUDA مستقلة تحتاج لإعادة دمجها يدويًا.

تتميز Kernel Forge بقدرتها على دعم أي نموذج PyTorch غير معدل، سواء كان في مجالات الرؤية، أو التوزيع، أو نماذج اللغة. وتستخدم تقنية البحث باستخدام شجرة مونت كارلو (Monte Carlo Tree Search - MCTS) لاستكشاف مسارات متعددة نحو التحسين بدلاً من الاعتماد على سلسلة تحسين خطية واحدة.

أيضًا، تأتي Kernel Forge مزودة بواجهة مستخدم رسومية تتيح للمستخدمين مراقبة التقدم، وفحص الشفرات المقترحة، وتصحيح الأخطاء بسهولة.

تم تقييم Kernel Forge على أربعة نماذج PyTorch تغطي مجالات الرؤية والتوزيع ونماذج اللغة، باستخدام جهاز NVIDIA DGX Spark مع وحدة معالجة الرسوميات GB10. ومع 50 دورة تحسين فقط لكل عملية، تحقق الأداة أداءً يفوق وضع PyTorch العادي، حيث بلغت تحسينات شاملة مثل:
- $1.52 imes$ على adaptive_avgpool2d في ResNet-50
- $1.70 imes$ على group_norm في Stable Diffusion 3.5 Medium
- $2.83 imes$ على softmax في Gemma 4 E2B
- $1.54 imes$ على softmax في Qwen 3.5 35B-A3B

مع Kernel Forge، يمكن للمطورين فقط التركيز على تحسين الأداء وكفاءة الشفرات دون التورط في التفاصيل المعقدة لكتابة الشفرات على مستوى منخفض.