يبدو أن التعلم المعزز بمكافآت يمكن التحقق منها (Reinforcement Learning with Verifiable Rewards - RLVR) أصبح لاعباً رئيسياً في تحسين قدرة نماذج اللغات الكبيرة (Large Language Models - LLMs) على إنتاج أكواد برمجية محسنة. لكن، العديد من الأساليب الحالية لم تأخذ في اعتبارها الخصائص الهيكلية الهامة اللازمة للحصول على أفضل أداء.
في هذا السياق، يتم تقديم CudaPerf، إطار عمل تعليمي مرن وذكي يدمج بين المكافآت القابلة للتحقق من التنفيذ والمكافآت الوعي بالهيكل الناتجة عن ميزات التوازي مثل تجميع الذاكرة وكثافة الحسابات ونمط التزامن. يعمل CudaPerf في مرحلتين: الأولى هي مرحلة تصنيف غير متصل (offline pairwise ranking module) تتعلم من خلالها تمييز المرشحين القويين والضعفاء من خلال مقارنات تباينية، والثانية هي مرحلة التدريب عبر التعلم المعزز (online RL training phase) التي تعزز من صحة وأداء وكفاءة الهيكل عبر إشارة مكافأة موحدة.
لرفع مستوى التعلم، يعتمد CudaPerf على تحسينات تكرارية باستخدام تغذية راجعة من التنفيذ، مما يتيح تحسين مستمر للمرشحين المولد. كما تم تقديم مجموعة بيانات تتضمن 2.9 ألف برنامج C إلى CUDA و1 ألف برنامج PyTorch إلى CUDA، كل منها مصحوب بمجموعة متنوعة من التكوينات المدخلة وتطبيقات CUDA متعددة تشمل استراتيجيات تحسين متنوعة.
أظهرت الدراسات التجريبية أن CudaPerf يتفوق بشكل ملحوظ على نماذج قوية مثل Qwen-3-32B لنقل C إلى CUDA وCUDA Agent لنقل PyTorch إلى CUDA، محققاً تحسينات تصل إلى 5X و3.32X في السرعة، و17% و7% في الصحة على التوالي. تشكل هذه التطورات علامة بارزة في عالم البرمجة، حيث يعيد CudaPerf تعريف كيفية استخدام التعلم المعزز في تحسين عمليات تطوير الكود.
ما رأيكم في هذا التطور الثوري في مجال توليد الأكواد؟ شاركونا تعليقاتكم!
تحسين توليد الكود باستخدام التعلم المعزز: تعرف على CudaPerf الثوري!
تقدم CudaPerf إطار عمل ثوري في مجال التعلم المعزز يعزز من قدرة نماذج اللغات الكبيرة (LLMs) على توليد كود محسّن بشكل لم يسبق له مثيل. بفضل مكافآته الصادرة عن بنية الأداء، يسجل CudaPerf تحسناً ملحوظاً في السرعة والصحة لأنظمة توليد الكود.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
