في عالم الذكاء الاصطناعي، تعتبر نماذج اللغات الضخمة (LLMs) من أبرز الإنجازات، حيث تعتمد على تقنيات تعزز قدراتها في توليد النصوص بطريقة تلقائية. لكن يوجد تحدٍ كبير يتمثل في ذاكرة التخزين (KV cache) التي تنمو بشكل خطي مع زيادة طول السياق، مما يخلق عائقًا كبيرًا في الأداء.
قدمت طرق الضغط الحديثة بعض الحلول لهذه المشكلة عن طريق دمج الرموز، لكن غالبًا ما تتسم هذه الطرق بالجمع العشوائي، مما يؤدي إلى تدهور التمثيلات وإدخال مفارقات في الانتباه (attention sag). ومن هنا، تم طرح إطار عمل جديد يقترح طريقة دمج ذاكرة التخزين الانتقائية (Selective KV Cache Merging) باستخدام آليتين مبتكرتين.
تعمل الآلية الأولى، المعروفة ببوابة التغاير الناعم (soft cosine gate)، على تعديل قرارات الدمج بناءً على تشابه القيم، مما يضمن تقييد أو تجاهل الرموز غير المتشابهة للحفاظ على الدقة الدلالية. بينما تطبق الآلية الثانية، آلية تعويض نسبة الانتباه (attention-ratio compensation)، انحيازًا تدريجيًا أثناء فك التشفير، مستندة إلى إحصاءات الانتباه السابقة، مما يعالج عدم التوازن الناتج عن عملية الدمج.
عند تقييم هذه الطريقة الجديدة على مجموعة بيانات LongBench المكونة من 16 مجموعة إنجليزية، أظهرت النتائج قدرة مذهلة، حيث احتفظ النظام بنسبة 25% فقط من ذاكرة التخزين مع أداء قوي مقارنة بخط الأساس (one-shot baselines). وكانت هذه التقنية خاصة فعالة عند الاختبار على نماذج الانتباه المجمعة (GQA)، حيث حافظت على جودة توليد نصوص قريبة جداً من الخسارة. علاوة على ذلك، تفوقت هذه الطريقة على نماذج التخزين الكاملة في المهام المعقدة، حيث حققت تسريعًا في فك التشفير يصل إلى 3.3 مرة مع 100000 رمز.
ثورة في نماذج الذكاء الاصطناعي: كيفية تجاوز قيود ذاكرة التخزين المتزايدة!
تمتاز نماذج اللغات الضخمة (LLMs) بقدرتها على توليد النصوص، لكن ظهور مشكلات في التخزين جعل أمر كفاءة الذاكرة مطلوبًا. الحل الجديد يقترح طريقة مبتكرة لدمج البيانات تعالج هذه التحديات وتمنح أداءً مذهلاً.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
