في خطوة مهمة نحو تحسين فعالية النماذج الكبيرة في الذكاء الاصطناعي، يقدم الباحثون تقنية جديدة تُعرف بـ 'Periodic Row-wise Muon'. تم تصميم هذه التقنية لتعزيز أداء نموذج Muon في تدريب الـ Diffusion Transformers (DiTs) ذات الـ 15 مليار بارامتر.

تعود فعالية Muon إلى طريقة تعامله مع البيانات، حيث يُحقق توازنًا رائعًا في التحديثات عبر الاتجاهات الفردية، مما يظهر مزايا هامة مقارنة مع الأساليب التقليدية مثل AdamW. من خلال دراسة سلوك Muon عند قياسه على نماذج مختلفة الحجم، توصل الباحثون إلى نتائج مدهشة تؤكد الحفاظ على جودة الأجهزة المتولدة مع ارتفاع عدد البارامترات.

لكن التحديات لا تنتهي هنا، حيث تتطلب تقنية NS5، المستخدمة في كل خطوة من خطوات تحسين الأداء، موارد حوسبة إضافية قد تعيق الفوائد التي يوفرها Muon. لذا، جاءت فكرة 'Periodic Row-wise Muon' التي تهدف إلى تقليل الأعباء الحسابية دون المساس بجودة الناتج.

تُظهر النتائج أن هذه التقنية الجديدة تحافظ على جودة التوليد المرغوبة، مع تقليل الوقت المطلوب للتدريب بنسبة تصل إلى 54.3%، مما يجعلها خيارًا جذابًا للباحثين والنماذج الضخمة في عالم الذكاء الاصطناعي. بالتالي، تسهم التحديثات الأخيرة في إحداث تغييرات إيجابية وزيادة كفاءة التدريب للـ DiTs.

تعد هذه التطورات علامة بارزة في مجال الذكاء الاصطناعي، حيث تفتح الأبواب أمام أفق جديد من الابتكارات والتطبيقات التي يمكن أن تغير طبيعة العمل في المستقبل القريب.