مع توفر تقنيات الذكاء الاصطناعي، تزداد أهمية تحسين الأداء وكفاءة الذاكرة في نماذج اللغات الطويلة (Long Context LLMs). وفي هذا السياق، تم الإعلان عن تقنية جديدة تُدعى Minima-KV، التي تهدف إلى معالجة مشكلة سعة وازدحام ذاكرة الكاش (KV Cache) بطريقة مبتكرة.

تعتمد Minima-KV على نظام هيراركي يحتفظ بالبيانات الأساسية مع تنسيقات مختلطة للانتقال، مما يعني أن الصفحات الحديثة المحمية تحتفظ بتنسيق FP8، في حين تُحول الصفحات الأقدم إلى تنسيق TQ3 المُعبأ. تأكيد الأنظمة المخصصة لتنسيقات معينة على حساب حالات الانتباه الجزئية (Partial Attention States) يجمعها عبر دمج عالمي من نوع online-softmax، مما يمكن للنماذج من فك تشفير البيانات بشكل فعال بدون الحاجة إلى ذاكرة ظلية كبيرة.

تم اختبار هذه التقنية على بطاقة الرسوميات NVIDIA RTX PRO 6000 Blackwell، حيث أظهرت نتائج مبهرة بضغط يصل إلى 3.50x مقارنة بـ BF16 و1.75x مقارنة بـ FP8. كما أظهرت جودة الأداء المثالية في تنفيذ المهام المُعقدة، مما يؤكد أنها تعتمد أسلوب جديد ومبتكر لضغط البيانات في سياقات طويلة، دون تراجع في الأداء.

تُعزز Minima-KV الأفق الجديد في تقنيات الذكاء الاصطناعي، حيث تقدم حلاً يوفّر استخدامًا فعّالاً للذاكرة ويسمح بوصول مباشر للبيانات المحفوظة. ومع هذا التطور، يُعد بمثابة خطوة ثورية نحو تعزيز الأداء والكفاءة في العالم الرقمي.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.