في ظل التسارع السريع في تطوير نماذج اللغة الضخمة (LLMs)، تواجه هذه النماذج تحدياً مهماً يتعلق بما يسمى "الانهيار التمثيلي". المشكلة تكمن في أن هذا الانهيار يؤثر بشكل حاد على أداء النماذج في التعامل مع السياقات الطويلة، مما يؤدي إلى تقليل فعاليتها بشكل ملحوظ.

تطرقت الأبحاث الأخيرة إلى هذا التحدي، مشيرةً إلى أن المناهج الحالية تواجه خطر الانزلاق نحو اثنين من extremos المرضية: انهيار التجانس (homogenization collapse) والذي ينجم عن "مغسلة الانتباه"، وانهيار العزلة (isolation collapse) الناتج عن "الانتباه المحلي" والذي يسبب انفصال السياق بشكل كبير.

من خلال تحليل الطيف لديناميات الانتباه، تم استنتاج توازن داخلي بين كفاءة الاختلاط (spectral gap) وسعة المعلومات (effective rank) التي تُعاني الآليات القياسية من صعوبات في تحقيق التوازن بينها.

لحل هذه المعضلة، تم اقتراح نهج جديد يسمى "المسار الجانبي المرتبط طوبولوجياً" (Topologically Regularized Side-Path - TRSP)، الذي يقدم تدخلاً معمارياً غير متداخل يحقق التوازن الطيفي. تعتمد تقنية TRSP على آلية "صندوق مثلثي" بدون معلمات، متوازنة بواسطة بوابة خفيفة الوزن تأخذ في الاعتبار طول المدخلات، وذلك لتنسيق تفاعلات الرموز.

من خلال دمج الاقتران القريب للحفاظ على تصنيف فعال وامتداد بعيد لدعم الاختلاط غير التدهوري، يشجع TRSP على مشغل انتقال هندسي أكثر صحة دون تعديل الانتباه الأساسي.

أظهرت التجارب تحسينات ملحوظة في القدرات العامة والمعايير المتعلقة بالسياقات الطويلة. على سبيل المثال، في اختبار NoLiMa مع زيادة طول التدريب بمقدار 8 مرات، أظهر TRSP دقة تصل إلى 83%، متجاوزاً نموذج Differential Transformer وGated Attention بحوالي 30% و50% على التوالي.

يمكنكم الاطلاع على الرمز المصدري لهذا البحث على GitHub: النقر هنا. هل تعتقد أن هذه التقنية ستحدث ثورة في نماذج اللغة الضخمة؟ شاركونا آرائكم في التعليقات!