يبدو أن التعلم المعزز بمكافآت يمكن التحقق منها (Reinforcement Learning with Verifiable Rewards - RLVR) أصبح لاعباً رئيسياً في تحسين قدرة نماذج اللغات الكبيرة (Large Language Models - LLMs) على إنتاج أكواد برمجية محسنة. لكن، العديد من الأساليب الحالية لم تأخذ في اعتبارها الخصائص الهيكلية الهامة اللازمة للحصول على أفضل أداء.

في هذا السياق، يتم تقديم CudaPerf، إطار عمل تعليمي مرن وذكي يدمج بين المكافآت القابلة للتحقق من التنفيذ والمكافآت الوعي بالهيكل الناتجة عن ميزات التوازي مثل تجميع الذاكرة وكثافة الحسابات ونمط التزامن. يعمل CudaPerf في مرحلتين: الأولى هي مرحلة تصنيف غير متصل (offline pairwise ranking module) تتعلم من خلالها تمييز المرشحين القويين والضعفاء من خلال مقارنات تباينية، والثانية هي مرحلة التدريب عبر التعلم المعزز (online RL training phase) التي تعزز من صحة وأداء وكفاءة الهيكل عبر إشارة مكافأة موحدة.

لرفع مستوى التعلم، يعتمد CudaPerf على تحسينات تكرارية باستخدام تغذية راجعة من التنفيذ، مما يتيح تحسين مستمر للمرشحين المولد. كما تم تقديم مجموعة بيانات تتضمن 2.9 ألف برنامج C إلى CUDA و1 ألف برنامج PyTorch إلى CUDA، كل منها مصحوب بمجموعة متنوعة من التكوينات المدخلة وتطبيقات CUDA متعددة تشمل استراتيجيات تحسين متنوعة.

أظهرت الدراسات التجريبية أن CudaPerf يتفوق بشكل ملحوظ على نماذج قوية مثل Qwen-3-32B لنقل C إلى CUDA وCUDA Agent لنقل PyTorch إلى CUDA، محققاً تحسينات تصل إلى 5X و3.32X في السرعة، و17% و7% في الصحة على التوالي. تشكل هذه التطورات علامة بارزة في عالم البرمجة، حيث يعيد CudaPerf تعريف كيفية استخدام التعلم المعزز في تحسين عمليات تطوير الكود.

ما رأيكم في هذا التطور الثوري في مجال توليد الأكواد؟ شاركونا تعليقاتكم!