تعتبر كفاءة نماذج التعلم العميق أمرًا حاسمًا لتحقيق الأداء العالي، ويتجلى ذلك في الطريقة التي يتم بها توجيه العمليات الرياضية المعقدة إلى الأجهزة الفيزيائية. وعلى الرغم من أن الأطر الرياضية الأساسية توفر مرونة، إلا أن نماذج التنفيذ فيها تواجه تحديات في الرؤية الشاملة، مما يتطلب الاعتماد على مكتبات نواة غير شفافة.

هنا تأتي نوفا (Nova)، وهي محول JIT آلي مصمم خصيصاً لسد الفجوة بين التنفيذ العام واستخدام الموارد. في الإصدار الجديد من نوفا، تم توسيع خط تجميع البيانات لدعم بنى Transformer بالكامل، مما يسمح بتحسينات هائلة عبر تنفيذ الرسوم البيانية بشكل كامل. وبدلاً من الاعتماد على المكتبات المجمعّة مسبقًا، تعمل نوفا على دمج عمليات متعددة في نواة واحدة، مما يقلل من تكرار استخدام الذاكرة العالمية للجهاز.

خلال تجاربنا مع تدريب نموذج GPT-2 الكامل على 6000 وحدة معالجة رسومية (GPU)، أظهرت نوفا أداءً رائعًا، حيث حققت متوسط نقل بيانات يصل إلى 421 ألف توكن في الثانية. بالمقارنة، كان الأداء 406 ألف توكن لنسخة التنفيذ النشيط الخاصة بنا و405 ألف لتطبيق torch.compile.

تمثل نوفا خطوة كبيرة إلى الأمام في تطور الذكاء الاصطناعي العميق، مما يمكّن من تجميع نماذج لغوية ضخمة بكفاءة على الأجهزة الحديثة مع الحفاظ على دقة الأرقام المطلقة.