تعد تصميم الطبقات التسلسلية القابلة للتعبير بكفاءة في الاستدلال من التحديات المركزية في التعلم الآلي الحديث. حيث حقق انتباه سوفتماكس (Softmax Attention) أداءً ممتازاً في نمذجة التسلسلات عبر تفاعلات غير خطية غنية بين الرموز. ولكن، تتطلب هذه التقنية تخزينًا ذاكرةً ينمو بشكل خطي مع زيادة طول التسلسل، مما يحد من قابليتها للتوسع.

من جهة أخرى، يوفر الانتباه الخطي (Linear Attention) حسابات دورية فعالة مع بصمة ذاكرة ثابتة، ولكن القدرة التمثيلية المنخفضة لها غالباً ما تؤدي إلى أداء نمذجة أقل.

لذا، نقدم لكم نظام Switching Linear Attention (SwiLA)، وهو طبقة تسلسل جديدة تعالج هذه الفجوة من خلال تعزيز القدرة التمثيلية مع الحفاظ على الحالة الثابتة ذات الحجم المحدد للانتباه الخطي. تم اشتقاق تكرار SwiLA من إطار العمل للانحدار في وقت الاختبار، حيث يتم تمثيل قاعدة تحديث الحالة كتعظيم للتوقع عبر مجموعة من نماذج الانحدار الخطي.

في وقت الاختبار، تختار كل بُعد من المخرجات ديناميكياً من بين عدة مكونات لانتباه خطي بناءً على المدخلات. في اختبارات استرجاع الذاكرة، التعلم اللغوي في السياق، ومعايير نمذجة اللغة، أظهر SwiLA أداءً قويًا وسد الفجوة مع انتباه سوفتماكس، متجاوزًا إياه في عدة إعدادات. هذا التطور يقدم إمكانيات جديدة لاستغلال التعلم الآلي بطرق لم تكن ممكنة من قبل.