تعاني أنظمة التعلم المعزز (Reinforcement Learning) من تحديات كبيرة في كفاءة نقل البيانات أثناء عملية التدريب. في هذا الإطار، تم تقديم تقنية جديدة تُسمى NeMo-DCR (Delta-Compressed Refit)، التي تعالج هذه المشكلة بذكاء.
تعمل NeMo-DCR على تفكيك عملية التدريب عن التوزيع، مما يعني أن كل تحديث لسياسة ما يجب أن يصل إلى مجموعات التنفيذ قبل الدفعة التالية. لكن كانت العملية التقليدية تستغرق وقتًا طويلًا لنقل نسخ كاملة من نقاط التفتيش (Checkpoints)، حتى 87.5 دقيقة بين منطقتين على AWS.
بفضل القياسات الحديثة التي أظهرت أن حوالي 1% من الأوزان تتغير في كل خطوة، جاءت NeMo-DCR لتحسين هذا الوضع. تستخدم التقنية الجديدة فقط التغييرات، لكنها تضمن دقة كاملة، مما يعني أن المستلمين يحصلون على نفس الأجزاء كما لو تم استخدام إعادة تجهيز مركزية.
يعتمد NeMo-DCR على تحسين طريقة المعالجة عبر وضع تغييرات في إحداثيات قياسية تسمح لها بالتكيف بسرعة مع أنظمة المستلمين. وتضمن عملية التحميل الأصلية تخزين جميع التغييرات بشكل موثوق.
تعمل تقنية NeMo-DCR على التحقق من فعالية ملحوظة، حيث يمكن لأساليب ضخمة تتراوح من 30B إلى 1T من العديلات أن تتم بسرعات تتراوح بين 12 إلى 40 مرة أسرع مما كانت عليه في نموذج مرجعي يعتمد فقط على النقل.
باختصار، تمكنت NeMo-DCR من تقليل فترة إعادة التجهيز من 87.5 دقيقة إلى 150 ثانية، مما يجعل إعادة تجهيز الأنظمة الذكية عمليًا عبر الكتل المتعددة وبالأخص بالنظر إلى الآفاق المستقبلية لتقنيات الذكاء الاصطناعي ذات النطاق التريليوني.
ما رأيكم في هذه التطورات الثورية؟ كيف ترون تأثيرها على مستقبل الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.
ثورة في التعلم المعزز: اكتشاف NeMo-DCR لزيادة كفاءة الذكاء الاصطناعي!
تمثل NeMo-DCR إنجازًا رئيسيًا في مجال التعلم المعزز، حيث تتيح نقل التحديثات بكفاءة أعلى للأنظمة الذكية. تقنية تسريع مسيرة الذكاء الاصطناعي نحو الفعالية والسرعة المطلوبة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
