في عالم نماذج اللغة الكبيرة (Large Language Models)، تبرز فأرة جديدة في تطوير الأداء تُعرف باسم DistillCache. يعتبر هذا الابتكار بمثابة ثورة في كيفية إدارة الذاكرة في نماذج Transformers التي تعاني من زيادة مستمرة في حجم ذاكرة التخزين المؤقت Key-Value (KV) كلما زادت طول السلسلة.
يتسبب هذا في bottleneck ذاكرة حاد، مما يتطلب حلولًا جديدة. بينما كانت تقنيات الإخلاء السابقة، مثل H$_2$O وSnapKV، تعتمد على إشارات ثابتة، غالبًا ما كانت هذه الطرق تفشل في استغلال التأثير التنبؤي المتوقع للرموز.
تقدم DistillCache التوجه الجديد الذي ينظر إلى إخلاء ذاكرة KV كمسألة قرار تسلسلي. تعتمد هذه العملية على نموذج شبكة خفيفة لتعلم سياسة فعالة، مستفيدة من إشارات داخلية غنية مثل إحصائيات الانتباه وقيم المعايير والموضع. يتم تدريب هذه السياسة باستخدام أسلوب REINFORCE عبر مكافأة استنادًا إلى انحراف KL للحفاظ على توزيع المخرجات.
أظهرت النتائج على نموذج Transformer مع 7 مليارات معامل، وهو Mistral-7B-Instruct-v0.3، أن DistillCache حافظ على 94.2% من دقة الذاكرة الكاملة خلال اختبار LongBench بميزانية ذاكرة تصل إلى 25%. كما تفوقت على طرق الإخلاء الأخرى بمعدل نقاط يتراوح بين 1.4 إلى 2.7، مما يجعلها واحدة من الحلول الأكثر فعالية في معالجة المهام الطويلة.
بالإضافة إلى ذلك، تُظهر DistillCache قدرة على زيادة إنتاجية الذاكرة الكاملة بنسبة تصل إلى 2.1 مرة مع الحفاظ على الكفاءة العملية المطلوبة. هذه النتائج تؤكد فعالية السياسات الذكية التي تدرك توزيع البيانات في تحسين كفاءة الأداء الخاص بنماذج اللغة الكبيرة ذات السياقات الطويلة.
إذا كنتم تحبون متابعة آخر التطورات في مجال الذكاء الاصطناعي ومدى تأثيرها على نماذج اللغة، فما رأيكم في هذا الإنجاز؟ شاركونا في التعليقات!
اكتشاف ثوري في تحسين أداء نماذج اللغة الكبيرة: DistillCache يمكن أن يحدث فارقاً هائلاً!
تقدم DistillCache، إطار عمل جديد يعتمد على التعلم التعزيزي، حلاً مبتكراً لمشكلة إدارة ذاكرة نماذج اللغة الكبيرة. قد يؤدي هذا الاكتشاف إلى تحسين الأداء وتقليل bottleneck الذاكرة بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
