في عالم الذكاء الاصطناعي، تمثل النماذج الضخمة (Massive Activations) نقطة تحول كبيرة في فهم كيفية إدارة وتوزيع التفعيلات داخل الشبكات العصبية، وبالأخص في نماذج المحولات (Transformers). تكشف دراسة حديثة عن عمليات النمو والتطور لهذه التفعيلات، بداية من الأكثر عشوائية وصولاً إلى السيطرة الراسخة خلال التدريب.

تبدأ هذه الرحلة بتحديد العلاقة بين ما يُعرف بـ "مراكز الانتباه" (Attention Sinks) والتفعيلات، حيث تبرز القنوات الحاملة لهذه التفعيلات، ولكن لم يكن من الواضح كيفية تنظيم حجم تلك التفعيلات خلال عملية التدريب.

من خلال تحليل المسارات التدريبية والتدخلات المدروسة، استطعنا تتبع ظهور ونمو وترسيخ هذه التفعيلات. ومن المفاجئ أن القنوات الحاملة تظهر نتائج متباينة عبر تجارب عشوائية، لكنها تستقر في وقت مبكر خلال كل تجربة.

على مدى فترة تدريب أطول، تتآكل القنوات المحيطة، مما يؤدي إلى تركيز التفعيل على عدد قليل من الحوامل الزائدة. يكشف تحليل مرونة الجGradient أن الكتلة التفعيلية الكلية ترتبط بجمع المتوسط الجذري لتفعيل الرموز (Root-Mean-Square) بدلاً من أي قناة فردية.

من النتائج الأساسية لهذا البحث أن تآكل الوزن (Weight Decay) يتحكم بشكل سببى في دوران حجم التفعيل العالمي. حيث أن إزالة التآكل بالقرب من القمة تسمح لهذا الحجم بالاستمرار في النمو، بينما يؤثر الاحتفاظ به على انخفاضه حتى عند معدل تعلم ثابت.

نقدم أيضًا نموذج توازن لفهم نمو حجم التفعيل الضخم، حيث يوازنان نمو (AdamW) ضد تآكل الوزن.

تظهر القياسات الإضافية أن التهيئة السابقة (Preconditioning) تحافظ على المجموعة الكبرى من القنوات ضد التآكل حتى عندما تكون القوى الخام غير كافية للحفاظ عليها. تحتشد هذه النتائج معًا لتربط دورة الحياة المرصودة للديناميات التدريبية المنظمة للحجم، وتؤسس لتآكل الوزن كرافعة يجب أن تؤخذ بعين الاعتبار في أوقات التدريب.