أعلن الباحثون عن اكتشاف مثير في عالم النمذجة الرياضية، حيث تم تطوير نموذج State Anomaly Neutralization (SANE) الذي يعد خطوة جديدة نحو استقرار النماذج القابلة للتكرار. يعاني نموذج Delta-Rule من مشاكل عدم الاستقرار عند extrapolation في سياقات متطرفة، حيث لاحظ الباحثون نمط فشل مميز يتمثل في انفجار محلي للنورم فوق قاعدة نادرة نسبيًا.
سعى الفريق لدراسة نموذج RWKV-7 على مدى تسلسل يصل إلى 100 مليون توكن، حيث أظهرت النتائج أن التحديثات المتكررة تصنع فجوة كبيرة في الأداء بسبب الانحلال المستمر الذي يحافظ على عدم استقرار الإدخالات الضعيفة. ومن ثم، تم اقتراح استراتيجية SANE، التي تطبق ضغطًا متكيفًا باستخدام دالة $ anh$ عند حدود الكتل، مع الحفاظ على الهيكل الموازي داخل الكتل.
أظهرت التجارب أن SANE يتماشى مع المعايير الأساسية على 11 معيار تفكير قصير السياق، رغم تجاوز عدد التوكنات 100 مليون توكن، بما يتجاوز 24,000 مرة طول التدريب. في هذه الحالة، يحتفظ SANE بإمكانية التفكير الوظيفي بينما يواجه النموذج الأساسي مشكلة overflow عددي.
تظهر هذه النتائج أن التحسين الرقمي لوحده لا يضمن إمكانيات التفكير الوظيفي، مما يكشف النقاب عن معادلة الموازنة بين السعة والثبات في ضغط الحالة. إن النتائج التي تم الحصول عليها تشير بوضوح إلى أن الابتكارات مثل SANE ستكون محور اهتمام كبار الباحثين في الذكاء الاصطناعي والنمذجة الرياضية.
ابتكار جديد: SANE لتحييد الشذوذ وتحقيق استقرار النماذج الرياضية المتقدمة!
تمتاز نماذج Delta-Rule القابلة للتكرار بمزايا كبيرة، لكنها تعاني من عدم الاستقرار في سياقات متطرفة. يقدم الابتكار الجديد SANE حلاً فعّالاً لتحييد الشذوذ واستقرار الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
