تُعتبر نماذج Transformers من بين التقنيات الرائدة في مجال تعلم الآلة، حيث تعتمد بشكل كبير على تطبيقات تحديد المعلومات المكانية. ومن بين الابتكارات الجديدة في هذا المجال، ظهرت تقنية Rotary Position Embedding (RoPE) التي تساعد في ترميز المعلومات المتعلقة بالموقع. ومع ذلك، فإن التطبيقات القياسية لهذه التقنية تعتمد على جدول تردد موحد وعوامل قياس متساوية لجميع رؤوس الانتباه، وهو ما قد لا يكون المثال المثالي.
تظهر الأبحاث، من خلال تجارب مبسطة تتعلق بالاسترجاع وسيناريوهات التعميم طولياً، أن الرؤوس التي تعمل بأدوار وظيفية مختلفة تحتاج إلى نطاقات تردد وقياس انتباه متميزة للحصول على الأداء الفعال. فإهمال هذه البنية يؤدي إلى سوء استخدام أبعاد التشفير وانخفاض الأداء، خاصة في الحالات التي تتطلب سياقات طويلة.
للتغلب على هذه النواقص، تم تقديم تقنية جديدة تُعرف باسم AdaRoPE. تعتمد AdaRoPE على تزويد كل رأس انتباه بترددات دوران قابلة للتعلم وعوامل قياس انتباه خاصة به. وفقًا للنتائج المستندة إلى تجارب، يتفوق النموذج المدرب مسبقًا باستخدام AdaRoPE على مختلف نماذج RoPE الأخرى، بما في ذلك نماذج RoPE الجزئية وNoPE.
علاوة على ذلك، توضح النتائج أن استخدام الترددات uniform وعوامل قياس الانتباه، كما هو مستخدم في تقنيات مثل YaRN، ليست مثالية. من خلال تطبيق قياس خاص بكل رأس، تمتاز AdaRoPE بقدرتها على تحسين الملاءمة السياقية مع الحفاظ على الأداء في السياقات القصيرة، سواء في إعدادات الاستقراء أو في إعدادات التعميم على السياقات الطويلة.
تؤكد هذه النتائج على أهمية تحسين تركيب التشفير الدائري على مستوى كل رأس انتباه منفصل، مما يمثل خطوة هامة نحو تطوير نماذج ذكاء اصطناعي أكثر كفاءة.
اكتشاف مذهل: تحسين رأس الانتباه في نماذج Transformers مع AdaRoPE
اكتشف كيف يمكن أن يؤثر تحسين رأس الانتباه في نماذج Transformers على الأداء والكفاءة. مع طرح AdaRoPE، يصبح بإمكان النماذج التعامل مع البيانات بشكل أفضل من خلال تخصيص ترددات دوران خاصة لكل رأس انتباه.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
