في عالم الذكاء الاصطناعي المتطور باستمرار، يحمل مفهوم DAMP (تقنية دائمة واعية للتقليل المختلط) آفاقاً جديدة من حيث كفاءة تخزين المعلومات وأداء النماذج. يعتمد العديد من تطبيقات الذكاء الاصطناعي المعقدة على الاستدلال السياقي الطويل، مما يؤدي إلى زيادة استخدام الذاكرة وتقليل الأداء بسبب النمو غير المراقب لمخازن مفاتيح القيمة (KV caches). قررت الفرق البحثية معالجة هذه التحديات من خلال دمج تقنيات مبتكرة مثل Softmax Attention مع Gated DeltaNet (GDN) و Kimi Delta Attention (KDA)، مما سمح بوجود حالات متكررة ذات حجم ثابت.

تعتبر هذه الحالات التقليدية، التي تُخزن عادة في دقة 32 بت عائمة (FP32)، مرهقة لجهاز معالجة الرسوميات (GPU)، وتحديداً بسبب قيود عرض النطاق الترددي لذاكرة الوصول العشوائي. على الرغم من أن تقنيات التكميم (Quantization) تساعد في تقليل الذاكرة المستخدمة وحركة البيانات، إلا أن الاستخدام غير المحسوب لتنظيم البيانات مثل INT8 و FP8 قد يتسبب في تدهور دقة الاستدلال المعقد. قد تسبب الطرق الأخرى، مثل INT4 و NVFP4، انهياراً شبه كامل للدقة.

تُعتبر دراسة DAMP الأولى من نوعها التي تبحث في كمياء التكميم بعد التدريب لحالات GDN و KDA، مما يكشف أن هناك انحداراً متسارعاً لبعض القنوات الرئيسية. وإدراكاً لذلك، يركز DAMP على مقدار خطأ التكميم الذي يمكنه الاحتفاظ به، حيث يُظهر أن قنوات معينة تُظهر انحداراً بطيئاً عبر المهام المختلفة.

استنادًا إلى هذه المعلومات، يقوم DAMP بدمج خطأي التكميم والانحدار لاختيار القنوات عالية المخاطر بشكل مسبق. تحت ميزانية تخزين ثابتة، يتم الاحتفاظ بهذه القنوات في دقة 16 بت عائمة (FP16) بينما يتم تخزين البقية في دقة 8 بت صحيحة (INT8). تم اختبار DAMP على نماذج معقدة مثل Qwen3.6-35B و Kimi-Linear-48B و Kimi-K3، حيث أظهرت النتائج أنه عند 9.9 بت لكل قيمة حالة، يحافظ DAMP على دقة متوسطة قريبة من FP32.

وفي اختبارات سريعة، أظهر DAMP تقليصاً في تخزين الحالة المتكررة بنسبة 69.1%، وكذلك أظهر تسريعاً في تطبيقات التحديثات يصل إلى 2.59 مرة، مما منخفض زمن النموذج بالكامل لكل رمز مُنتج بنسبة 19.0%. هذه النتائج تُظهر كيف يمكن للجديد في هذا المجال دفع حدود الأداء في الذكاء الاصطناعي.

ما رأيكم في هذه التطورات المثيرة؟ هل تعتقدون أن هذا سيفتح آفاق جديدة في الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!