في عالم تمتاز فيه نماذج اللغة الضخمة (Large Language Models) بقدرتها على إنجاز مهام سمعية معقدة، تبرز التحديات المتعلقة بالذاكرة. تلك الذاكرة، والمعروفة بذاكرة KV، تتطلب حجمًا كبيرًا مما يعرقل العمليات الفكرية الطويلة. في هذا السياق، تم تقديم VoxZip كحل مبتكر.

VoxZip ليس كغيره من الأساليب المعتمدة على ضغط النصوص، بل يعتمد على إطار عمل فريد من نوعه لا يتطلب تدريبًا مسبقًا. يتكون VoxZip من مرحلتين رئيسيتين: المرحلة الأولى تعتمد على تحويل الكلام التلقائي (Automatic Speech Recognition - ASR) لتكون بمثابة دعامات دلالية، حيث تدعم تسلسل وضغط وتوحيد رموز الصوت. هذه الخطوة تؤدي بشكل كبير إلى تقليل حجم ذاكرة KV الأولية وزيادة كثافة معلومات الرموز.

أما المرحلة الثانية، فتقوم بتطبيق استراتيجية تصفية ديناميكية بناءً على مدى الاهتمام المتراكم عبر الوقت، مما يسمح بإزالة الرموز غير الأساسية ويخفف من انحياز الرموز المبكرة. تم اختبار VoxZip بدقة على نموذج Qwen3-Omni عبر ستة بنوك صوتية متنوعة، مما أثبت تفوقه في معالجة الاستنتاج الطويل الأمد مع الحفاظ على دقة عالية في المهام القصيرة.

ومن المذهل أن VoxZip يحافظ على أكثر من 90% من أداء النسخة غير المضغوطة حتى عند ضغط ذاكرة KV بشكل صارم بنسبة 20x، وكذلك يحقق زيادة بنسبة 1.9x في سرعة استدلال مع تخفيض بنسبة 3.3x في الذاكرة العُليا. ستتوفر الأكواد والنماذج على GitHub.

ما رأيكم في هذه التطورات التقنية المبهرة؟ شاركونا آراءكم في التعليقات!