في عالم الذكاء الاصطناعي، لطالما كانت المعلومات الموضعية تلعب دورًا أساسيًا في معالجة اللغة الطبيعية. تُعد عملية الانتباه (Attention) في النماذج التحويلية (Transformers) غير حساسة للموضع بشكلٍ بديهي، مما خصصت له العديد من تقنيات تشفير المواقع مثل تشفير المواقع الدوارة (Rotary Position Encoding - RoPE). ومع ذلك، فإن الأبحاث الأخيرة قد أظهرت أن أساليب جديدة مثل الانتباه من خلال نافذة زلقة (Sliding Window Attention - SWA) والانتباه الخطي المدعوم (Gated Linear Attention) قد نجحت في توفير النتائج المبهرة على نطاق واسع، دون الحاجة لتشفير المواقع في الطبقات الانتبهية العالمية.

تسعى هذه الورقة إلى تقديم تفسير لسبب وكيفية نجاح النماذج الهجينة في تشفير الموقع بشكل ضمني في طبقات الانتبه العالمية (Global NoPE). من خلال الأدلة النظرية والتجريبية، يظهر أن SWA والانتباه الخطي المدعوم يُعززان ميلاً نحو المعلومات الأحدث في التيار المتبقي (Residual Stream)، ما يؤثر بشكل إيجابي على نتيجة الانتباه العالمية.

على عكس التشفيرات المكانية الضمنية الموجودة في نماذج NoPE العالمية التي تعتمد فقط على القناع السببي، تكون ميزة التحيز نحو المعلومات الحديثة في النماذج الهجينة قابلة للحفاظ عليها عبر تسلسلات طويلة. تُسهم هذه النتائج في توسيع فهمنا لكيفية تشفير المعلومات الموضعية وقد تعطي رؤى جديدة حول كيفية تشفير المواقع بطرق تجعلها قابلة للاستخدام في تسلسلات طويلة جدًا.

في ضوء هذه التطورات، قد نكون على أعتاب عصر جديد من نماذج اللغة الطبيعية التي تمتلك القدرات الفائقة على فهم السياق المعقد والتعامل مع المعلومات بشكل أكثر فعالية. ما هي آراؤكم حول هذا التطور المثير؟ شاركونا في التعليقات.