يعتبر ميكانيزم الانتباه الذاتي (Self-Attention) عنصرًا محوريًا في نجاح هياكل نماذج التحويل (Transformer Architectures). ومع ذلك، أثبتت الدراسات أن الانتباه العشوائي الصفحي المعتاد قد يعاني من تدهور كبير في الإشارة عبر الطبقات، مما يؤدي إلى انهيار الرتبة (Rank Collapse). تتجلى هذه المشكلة في ظهور تمثيلات متجانسة للغاية، بالإضافة إلى انهيار الإنتروبي (Entropy Collapse)، الذي يظهر من خلال توزيع انتباه شديد التركيز.

أشارت الأبحاث الحديثة إلى ميزات تقنية الانتباه المزدوج العشوائي (Doubly Stochastic Attention) كوسيلة لتنظيم الإنتروبي، مما يعزز من توزيع انتباه أكثر توازنًا ويؤدي إلى أداء تجريبي أفضل.

في دراستنا هذه، نناقش كيفية تدهور الرتبة عبر عمق الشبكة ونتناول مزايا استخدام مصفوفات الانتباه المزدوج العشوائي المعتمدة على خوارزمية سينكهورن (Sinkhorn Algorithm) في الحفاظ على الرتبة بشكل أكثر فعالية مقارنة بالأسلوب العشوائي الصفحي المعتاد.

كما أظهرت الدراسات أن نقاط الاتصال المنزلق (Skip Connections) تلعب دوراً مهمًا في التخفيف من تدهور الرتبة، وهو ما نتحقق منه تجريبيًا في مهام تحليل المشاعر وتصنيف الصور.

علاوة على ذلك، نستمد حدًا نظريًا لتدهور رتبة الانتباه الذاتي النقي عند استخدام التنظيم على أسس سينكهورن، حيث نجد أن الرتبة تتلاشى إلى واحد بتناقص د doubly مع العمق، وهو ظاهرة تم إثبات حدوثها سابقًا في الأسلوب الصفحي.

ما رأيكم في هذه التطورات الجديدة في عالم الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات.