في عالم الذكاء الاصطناعي، تعتبر نماذج اللغة الكبيرة (Large Language Models) عماد العديد من التطبيقات الحديثة، لكن تظل مشكلة انخفاض الدقة في النماذج بسبب محدودية دقة تخزين البيانات (KV-Cache) واحدة من التحديات الرئيسية. دراسة جديدة نشرت على arXiv تحت عنوان 'High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration' تسلط الضوء على أسلوب مبتكر يمكنه تحسين دقة استنتاج النماذج بشكل كبير.

حتى الآن، كانت تقنية تقليل دقة تخزين KV-Cache تستخدم لتقليل الأعباء على الذاكرة والنطاق الترددي، لكنها غالباً ما تؤدي إلى انخفاض ملحوظ في الأداء. على سبيل المثال، أدى تقليل دقة البيانات إلى 1 بت فقط إلى انخفاض دقة نموذج Llama-3.1-8B إلى 47.8%. ولكن الدراسة الجديدة تتحدى الفكرة التقليدية بأن الدقة المنخفضة للأرقام المطلقة هي السبب في هذا التدهور.

تشير النتائج إلى أن السبب الحقيقي يتمثل في سوء التصنيف الهيكلي المحلي، حيث يتأثر توزيع البيانات في منطقة أعلى K بتغيرات غير مرغوب فيها. لذا، تم اقتراح تقنية جديدة تُعرف باسم استعادة التوزيع المحلي لتعويض هذا الخلل. من خلال كشف الأخطاء في الخطوات ذات المخاطر العالية، تمكنت التقنية من استعادة توزيع البيانات بشكل دقيق قبل اختيار الرموز.

تم تنفيذ تقنية DGAP لتحقيق هذه الاستعادة المحلية، وقد أظهرت التجارب على نموذج Llama-3.1-8B أن الدقة قد عادت من 47.8% إلى 83.2% مع تقليل انحراف التوزيع. في ظل التطبيقات الواسعة مثل Llama وMistral وQwen، حافظت التقنية على استخدام منخفض لدقة التخزين مع تأثير طفيف على سرعة معالجة البيانات.

بفضل هذه التطورات الجديدة، سيتمكن المطورون من استخدام نماذج اللغة الكبيرة بشكل أكثر كفاءة وبدقة أعلى، مما يفتح آفاقاً جديدة في مجالات متعددة. كيف ترون مستقبل هذه التقنية في الذكاء الاصطناعي؟ شاركونا في التعليقات!