في عالم معالجة اللغات الطبيعية، تعد نماذج اللغة الضخمة (Large Language Models) ركيزة أساسية للتطور التكنولوجي. ومن أبرز التحديات التي تواجه هذه النماذج هو كيفية التعامل مع السياقات الطويلة، حيث يُعتبر أداء الذاكرة المؤقتة (Key-Value Cache) عائقًا رئيسيًا. هنا يأتي دور تقنية LOCKS (Page-Local Compact Key Summaries) لتحدث ثورة في طريقة معالجة نصوص ضخمة بفعالية.

تستند تقنية LOCKS إلى فكرة أن مفاتيح الانتباه (Attention Keys) تمتلك خصائص محلية منخفضة الرتبة لكنها عالية الرتبة على مستوى عالمي، مما يعني أن القواعد المشتركة ذات الرتبة المنخفضة تتجاهل الاتجاهات الخاصة بالصفحات الفردية. من خلال توفير تلخيص طيفي خاص بكل صفحة، تخفض LOCKS حجم الذاكرة المؤقتة الخاصة بها إلى عُشر حجمها الأصلي.

تقوم التقنية بإعادة بناء قيم المخرجات (Logits) داخل كل صفحة، وتقدير كتلة الانتباه لكل صفحة باستخدام دالة اللوجاريتم والملخص، مما يتيح لها التركيز فقط على الصفحات ذات الأهمية. أثبتت LOCKS فعالية كبيرة على الاختبارات مثل LongBench-v1، حيث حافظت على دقة قريبة من استخدام الذاكرة المؤقتة بالكامل. وقد أظهرت أيضًا تقدمًا ملحوظًا في مهام التفكير المنطقي على مجموعات البيانات الكبيرة مثل AIME26 وMATH-500.

عند استخدام ميزانية 2048 توكن، تتمكن LOCKS من مطابقة جودة FullKV Aggregated في سياقات كبيرة تربو على 100,000 توكن، بينما تقوم بمعالجة حوالي 2% فقط من التوكنات. بالإضافة إلى ذلك، تم تحسين زمن استجابة النموذج بمقدار الضعف مقارنةً بالانتباه الكثيف.

وما يميز هذه التقنية هو أنها تأتي كإضافة سهلة الدمج (Drop-in Plugin) لنماذج vLLM غير المعدلة، مما يسهل تطبيقها دون الحاجة إلى تغييرات جذرية. لذا، يُظهر التقدم المحرز من خلال LOCKS إمكانيات واعدة لمستقبل أكثر كفاءة في معالجة اللغات الطبيعية.