في عالم الذكاء الاصطناعي المتقدم، تعتبر ذاكرة الكي-فالي (KV Cache) نقطة ضعف رئيسية في أداء نماذج اللغة الطويلة المدى (Long Context LLMs)، حيث تعاني من ضغط هائل على سعات الذاكرة والنطاق الترددي. ولتخفيف هذا العبء، تم تقديم مفهوم الكوانتيزشن المتجهة (Vector Quantization - VQ) كوسيلة واعدة لضغط ذاكرة KV بشكل عدواني.
ومع ذلك، تعاني الطرق الحالية في VQ من ضعف كبير عند استخدام نظام 1-بت، حيث يتطلب هذا الضغط الشديد أن يمثل كل نموذجً مجموعة أكبر من القنوات عبر مجموعة محدودة من مراكز التوزيع، مما يجعل من الصعب الاستفادة الفعالة من سعة هذا النموذج.
لمعالجة هذه المشكلة، تم تطوير تقنية جديدة تُعرف باسم TaSQ، التي تعمل على تحسين مساحة الكوانتيزشن من خلال دمج وزن القنوات المدعوم بالاستعلام (Query-guided channel weighting) وتطبيع الرأس المتقاطع (Cross-head normalization) وتجميع القنوات المستندة إلى التغاير (Covariance-aware channel grouping) لتعكس بشكل أفضل حساسية الخطأ والبنية الإحصائية لإشارات التفعيل المخزنة.
كما أن هذه التحولات متوافقة مع تقنية RoPE ويمكن دمجها بسهولة في أوزان الإسقاط ونماذج الكود، مما يحافظ على الهيكلية التقليدية لعمليات البحث في VQ ويضيف أقل تكلفة تخدم العمليات.
عند اختباره عبر معايير مختلفة في التفكير العميق (Chain-of-thought) واسترجاع سياقات طويلة، أثبتت TaSQ أنها تتفوق باستمرار على القواعد الحالية لنموذج VQ في ضغط الذاكرة ذو النسبة المنخفضة، مع الحفاظ على استقرار التفكير.
على جهاز RTX 6000 Ada GPU واحد، يدعم تنفيذ SGLang الخاص بها أحجام دفعة تصل إلى 14 ضعفًا أكبر ويحقق قدرة إنتاجية ذروة أعلى بنسبة 1.87 مرة مقارنة بنموذج BF16.
في النهاية، يقدم TaSQ تقنية مبتكرة تؤكد قدرة الذكاء الاصطناعي على تخطي التحديات المألوفة ويعزز من قدراته في التعامل مع البيانات الكبيرة بفعالية وكفاءة.
تكنولوجيا مبتكرة: تحسين مساحة الكوانتيزشن لضغط ذاكرة KV بكفاءة عالية!
قدم الباحثون تقنية جديدة تُعرف باسم TaSQ، والتي تعزز فعالية ضغط ذاكرة KV في نماذج الذكاء الاصطناعي. هذه التقنية تُسهم في تحسين أداء النماذج بتقليل الضغط على الذاكرة وزيادة السعة بشكل فعال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
