تتزايد أهمية نماذج اللغة الكبيرة (LLMs) في مجال الذكاء الاصطناعي بفضل تقدمها في معالجة اللغات الطبيعية. ومع ذلك، فإن كفاءة الاستدلال المسندة إلى هذه النماذج تعتمد بشكل متزايد على استراتيجيات إدارة ذاكرة التخزين المؤقت باستخدام ذاكرة المفاتيح والقيم (KV Caches). تكمن أهمية هذه الذاكرات في قدرتها على تخزين المتجهات المخزنة من المفاتيح والقيم في كل طبقة، مما يقلل من عملية الحساب المتكررة أثناء توليد الرموز الآلية.

ومع ذلك، يشكل تنامي حجم الذاكرات تحديات كبيرة على مستوى النظام، خاصة مع زيادة حجم النماذج وتزايد أطوال السياقات وطلبات الاستخدام المتزايدة. تظهر العديد من الأطر الجديدة في إدارة ذاكرة التخزين المؤقت، إلا أن فوائدها مقارنةً بالاستدامة في استهلاك الذاكرة والأداء لم تُفهم بصورة كاملة بعد.

في هذه الدراسة، قمنا بإجراء بحث تجريبي يركز على ثلاثة أطر رائدة في إدارة ذاكرة التخزين المؤقت وهي vLLM و InfiniGen و H2O. حيث تتبنى هذه الأطر تقنيات مثل نقل التوترات، وتخليص الرموز، والجدولة الاستباقية لتحقيق التوازن بين استخدام الذاكرة والأداء.

عبر تقييم شامل لقياسات مختلفة تتضمن زمن الاستجابة والإنتاجية واستخدام الذاكرة، قمنا بتحليل الأداء في ضوء مجموعة واسعة من المتغيرات مثل معدلات الطلب، وأحجام النماذج، ومعدلات الندرة. تكشف النتائج عن الظروف التي تحقق فيها كل إطار أداءً فعالاً، مما يوفر توجيهات مثيرة لاختيار التكوين الأنسب لاستراتيجيات تخزين المفاتيح والقيم بناءً على قيود الذاكرة والأداء.