في عالم الذكاء الاصطناعي، تعتبر نماذج المحولات (Transformers) من أكثر النماذج استخدامًا، ولكن تحسين أدائها لا يزال يمثل تحديًا كبيرًا. تميل هذه النماذج إلى الاعتماد بشكل كبير على المحسّنات التكيفية مثل Adam، لكن لماذا يحقق Adam أداءً أفضل من خوارزمية النزول التقديري العشوائي (SGD

تتحرى الدراسة الجديدة في هذا السياق عن مفهوم هتروجينية التدرجات (Gradient Heterogeneity)، والذي يُعرّف بأنه تباين في مقاييس التدرجات عبر كتل المعلمات. عبر التحليل النظري، تشير النتائج إلى أن هتروجينية التدرجات، إلى جانب هتروجينية الهاس (Hessian Heterogeneity)، تؤثر سلبًا على التقارب في الطرق المعتمدة على التدرجات مثل SGD.

ومع ذلك، تعمل طرق مثل SignSGD على تقليل حساسية التقنيات لهذه الظاهرة، حيث تجري تحديثات تخدم التدرجات بشكل أكثر دقة. وهذا يعزز استخدام SignSGD كنموذج قابل للتحليل يمكن مقارنته بسلوك Adam.

تُظهر النتائج التجريبية التي تم الحصول عليها من ضبط نماذج المحولات في مجالات معالجة اللغة الطبيعية (NLP) والرؤية أن هتروجينية التدرجات تتأثر بشكل كبير بمكان وضع تطبيع الطبقات، حيث تظهر البُنى المعمارية ما بعد التطبيع (Post-LN) هتروجينية ملحوظة.

تفتح هذه النتائج آفاقًا جديدة في فهم كيفية تحسين النماذج في المستقبل وتقدم رؤى مهمة يمكن أن تؤثر على مجالات أخرى في الذكاء الاصطناعي.