في عالم الذكاء الاصطناعي المتسارع، تبرز التحديات المرتبطة بنشر نماذج اللغات الضخمة (LLMs) عندما تنفد مساحة ذاكرة العمليات (KV cache). في محاولة لمعالجة هذا، يتم استخدام أسلوبين رئيسيين: التوازي التنسوري (Tensor Parallelism) وضغط KV (KV Compression).

ضغط KV">التوازي التنسوري مقابل ضغط KV


يستند التوازي التنسوري إلى تقسيم الأوزان وذاكرة KV عبر جهازين أو أربعة أو ثمانية أجهزة. بينما يمكن لهذا الأسلوب زيادة سعة الذاكرة، إلا أن ذلك يأتي بتكلفة إضافية، حيث يتطلب أداء عملية تخفيض شامل في كل طبقة مع ارتفاع تكاليف الأجهزة.

من جهة أخرى، يتبنى ضغط KV تقنيات تقليص الحجم مع الحفاظ على النظام وحدة معالجة الرسوميات الواحدة، مما يوفر بعض الجودة تحت ضغط الذاكرة.

نتائج الدراسة">نتائج الدراسة


في دراسة جديدة تم تحليل أداء تقنيات التوازي التنسوري وضغط KV بمقارنة التكاليف مقابل الزمن، من خلال استخدام محاكيات مكافئة تعتمد على معالجات A100 وA40 وH100. وقد أظهرت النتائج أن ضغط KV يتمتع بفعالية من حيث التكلفة تتراوح بين 1.20x إلى 2.00x مقارنة بالتوازي التنسوري.

بينما يمكن لنموذج بقيمة 7 مليار أن يستخدم بطاقة ذاكرة سعتها 80 غيغابايت، فإن الحد الفاصل الذي يحدد اختيار الاستراتيجية ما بين حجم النموذج وذاكرة الجهاز يتحدد عند حوالي 36 مليار بارامتر لبطاقات الذاكرة السالفة الذكر.

الاختيار النهائي


تسفر النتائج عن استنتاج أن ضغط KV هو الاستراتيجية الأكثر فعالية في حالة نماذج اللغات الصغيرة والمتوسطة، بينما تصبح تقنيات التوازي التنسوري ضرورية في الحالات الحرجة حيث تتطلب النماذج الأكبر (مثل Llama-2-70B) مزيداً من القوة الحاسوبية. يُعد التوازي التنسوري الخيار الوحيد الذي يُحسن زمن الاستجابة، ولكن ضغط KV هو الذي يزيد السعة في التكلفة.