في الوقت الذي تزداد فيه شعبية نماذج الذكاء الاصطناعي التي تتعامل مع سياقات طويلة، تظهر الحاجة لتحسين الكفاءة وزيادة سرعة الاستدلال. ولتلبية هذا الطلب، قدم الباحثون تقنية جديدة تُسمى كاسكاد (Kascade)، وهي طريقة مبتكرة تعتمد على انخفاض الاهتمام (Sparse Attention) دون الحاجة إلى تدريب إضافي.
تستند كاسكاد على ملاحظات تم التوصل إليها مسبقًا، مثل أن الاهتمام بعد مرحلة الـ Softmax يُظهر طابعًا متشتتًا، وأن هوية المفاتيح ذات الوزن العالي تبقى ثابتة عبر الطبقات القريبة. يعتمد التصميم على حساب الأ índices العلوية (Top-k indices) بدقة في مجموعة صغيرة من الطبقات الرئيسية (Anchor Layers)، ويتم إعادة استخدام هذه المؤشرات في الطبقات المتوسطة بسهولة.
عملية اختيار الطبقات تكون آلية، بناءً على هدف برمجة ديناميكية تقصى أقصى تشابه بين الطبقات عبر مجموعة تطوير، مما يُنهي الحاجة لتعديلات معقدة على النماذج المختلفة. يعزز Kascade كفاءة العمليات من خلال قيود تنفيذ فعالة (مثل العمليات على مستوى البلاطة) سواء في مرحلة التحضير أو في مرحلة فك التشفير.
تظهر التجارب أن اختيار واستخدام Top-k في كاسكاد يراعي الرأس (Head-Aware) وهذا يعد عنصرًا حاسمًا لتحقيق دقة عالية. وقد حقق كاسكاد تسريعًا يصل إلى 4.1 مرة في فك التشفير و2.2 مرة في التحضير مقارنةً مع اساسيات FlashAttention-3 على أجهزة H100 GPUs، في الوقت الذي حافظ فيه على دقة الاهتمام الكثيف على معايير السياقات الطويلة مثل LongBench وAIME-24.
إن التقدم الذي يسجله Kascade يعكس جهود المجتمع البحثي في تحسين فعالية نماذج الذكاء الاصطناعي، ويعزز مكانة هذه الأدوات في تطبيقات متعددة تتطلب معالجة سريعة ودقيقة.
Kascade: ثورة في أداء نماذج لغات الذكاء الاصطناعي ذات السياقات الطويلة
استعرضت الأبحاث الأخيرة كاسكاد (Kascade)، تقنية جديدة تُحدث طفرة في كفاءة نماذج الذكاء الاصطناعي ذات السياقات الطويلة. الدراسة توضح قدرة هذه التقنية على تسريع عمليات الاستدلال وزيادة الدقة بشكل مثير للاهتمام.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
