تواصل الأبحاث في مجال الذكاء الاصطناعي تحسين إمكانية استدلال نماذج اللغات الضخمة (LLMs)، ومع ذلك، فإن كفاءة هذه النماذج تتعرض للعديد من التحديات. فقد أظهرت الدراسات أن استخدام الذاكرة في استدلال النماذج يتم إعاقة كفاءته بسبب تعقيد الانتباه الرباعي (quadratic attention complexity) ونمو ذاكرة القاموس (Key-Value) بصورة خطية.

بدلاً من معالجة هذه المشكلة من خلال طرق انتقائية بعد حدوث العملية أو إخلاء بعض المدخلات غير الضرورية، تطرقت ورقة بحثية جديدة إلى جذور المشكلة من خلال إدارة دخول الرموز بشكل أكثر تميزًا.

تقدم الورقة مفهوم "إدارة الذاكرة" كمنظومة سببية تتكون من ثلاث عمليات رئيسية: قبول رموز القاموس (KV Admission)، الاختيار (Selection)، والإخلاء (Eviction).

تم تنفيذ قبول رموز القاموس من خلال آلية Write-Gated KV (WG-KV)، والتي تعد تقنية خفيفة الوزن تتعلم كيفية توقع فائدة الرموز قبل دخول القاموس. من خلال تصفية الحالات غير الضرورية مبكرًا، يتم الاحتفاظ بذاكرة عالمية مدمجة إلى جانب ذاكرة محلية منزلقة.

أثبتت التجارب أن هذه التقنية لا تقلل فقط من استخدام الذاكرة، بل تسرع أيضًا مراحل تعبئة البيانات وفك الشفرة، مما يظهر أن تعلم ما يجب كتابته يعد وصفة منهجية وعملية لاستدلال طويل السياق.

للمزيد، يمكنك زيارة المستودع البرمجي هنا.