في عالم الذكاء الاصطناعي، يمثل تخزين المعلومات أحد أكبر التحديات التي يواجهها الباحثون والمطورون. عندما يتعلق الأمر بالمحولات الذاتية التكرار (autoregressive transformers)، فإن كاش مفتاح-قيمة (KV cache) ينمو بشكل خطي مع طول السياق، مما يؤدي إلى زيادة استهلاك الذاكرة في الحالات التي تتطلب سياقات طويلة.
بينما تسعى معظم الحلول التدريبية المجانية إلى إخلاء الرموز الأقل أهمية، فإن ذلك يمثل خياراً غير قابل للإرجاع على طول محور التسلسل. وهنا تأتي الابتكارات مع نظام AttSVD.
تعمل AttSVD من خلال الحفاظ على كل رمز وتخزينه بشكل أكثر كفاءة على محور "الميزة". هذا الابتكار يعني أنه يتم ضغط البيانات بشكل منخفض الرتبة وذلك وفقاً الهندسة الخاصة بالاهتمام لكل مطالبة، من خلال استخدام تقنية القيم المفردة المنقوصة (SVD) على مستوى كل مطالبة.
يتم تقدير هذا النظام بشكل متقدم ليبقي فقط الاتجاهات التي يقرأها الانتباه، مما يقلل من الحاجة إلى ذاكرة KV في كل رأس وفقاً للرتبة التي تم الاحتفاظ بها.
كما نقدم استراتيجيتين.Cache خلال وقت فك التشفير، والتراكمية والتدفقية، وهو ما يناسب الأجيال القصيرة والطويلة. وأيضاً طُوِّرَت تحسينات تجعل من ضغط البيانات أكثر توافقًا. فالقاعدة الخاصة بالطاقة لكل مصفوفة تعمل على تحجيم مساحة السجل بصورة مستقلة عن كتل الانتباه. كما يتم تقليص القاعدة المرتبطة بالاهتمام فقط في الفضاءات التي يقرأها الانتباه، مما يحافظ على كل من سجلات الانتباه ونتائج الانتباه.
تعتبر AttSVD مثالاً رائداً على كيفية تأثير التقنيات المتقدمة على تحسين أداء أنظمة الذكاء الاصطناعي، حيث أثبتت فعاليتها ضمن العديد من النماذج، محافظةً على مستواها في الأداء إلى جانب الكاش الكثيف مع استخدام يصل إلى 50% فقط من ذاكرة KV.
هل أنتم مستعدون لاستكشاف مزيد من الابتكارات في هذا المجال؟ شاركونا آرائكم في التعليقات.
ثورة في تخزين البيانات: تعرف على تكنولوجيا AttSVD لتحسين أداء المحولات الذكية!
تقدم التكنولوجيا الجديدة AttSVD طريقة مبتكرة لضغط تخزين الكاش في المحولات، مما يقلل من الذاكرة المطلوبة بنسبة تصل إلى 50%. تعلم كيف يمكن لتقنيات الذكاء الاصطناعي أن تتطور لتساعد في تحسين الكفاءة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
