في عالم الذكاء الاصطناعي، تتزايد الحاجة إلى نماذج سياق طويل تعمل بكفاءة. ومع ذلك، فإن بصمة الذاكرة لذاكرة التخزين المفاتيح-القيم (KV Cache) تلعب دورًا حاسمًا في استخدام هذه النماذج بشكل فعال. تمثل هذه المثيرة للجدل تكاليف عالية عندما يكون السياق المسبق محملاً بشدة. للحد من هذه التكلفة، تم تطوير KV²، وهي طريقة مبتكرة لضغط ذاكرة التخزين المفاتيح-القيم تعتمد على إعادة البناء الانتقائية.
تعتمد KV² على استخدام مقياس خفيف الوزن لتحديد الرموز السياقية الأكثر فائدة، مما يعني أنها تعيد معالجة مجموعة فرعية فقط من البيانات لتحديد نقاط الإخلاء النهائية. هذه التقنية فاجأت مجتمع الذكاء الاصطناعي بسلوكها المذهل في تحسين الأداء على نماذج مثل RULER وNeedle-in-a-Haystack وLongBench. حيث أظهرت KV² تفوقًا كبيرًا على القواعد التقليدية، مثل تحقيق تحسن متوسط في الدرجات يزيد عن 40 نقطة مئوية في بعض السيناريوهات.
السرعة والكفاءة هما العنوانان الرئيسيان لهذه التقنية؛ حيث إن KV² لا تتطلب إعادة معالجة السياق الكامل، مما يجعلها خيارًا مثاليًا للنماذج المستخدمة في البيئات ذات التكاليف المنخفضة. الجوانب التقنية والنتائج كانت مشجعة للغاية، ويمكن لجميع المهتمين الوصول إلى كود التقنية على الرابط المخصص واستخدامه في مشروعاتهم الشخصية.
اكتشاف مذهل: KV² - طريقة جديدة لضغط ذاكرة التخزين المفاتيح-القيم!
في خطوة جريئة نحو تحسين نماذج السياق الطويل، تم تقديم KV² كطريقة مبتكرة لضغط ذاكرة التخزين المفاتيح-القيم (KV Cache). هذه التقنية تعد بتحسين الأداء وتقليل التكاليف بشكل مذهل.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
