في عالم الذكاء الاصطناعي، يتميز نموذج اللغات الضخمة المبني على تقنية الانتشار (Diffusion Large Language Models - DLLMs) بقدرته على توليد النصوص بشكل متوازي عبر تقنية Semi-Autoregressive (SAR). ومع ذلك، كانت هنالك مشكلة كبيرة في الطرق الحالية، حيث كانت تعاني من إعادة حساب غير فعالة على مستوى العوامل، مما يتطلب إعادة حساب كامل للسلسلة خلال خطوات إزالة الضوضاء، دون الأخذ بعين الاعتبار أن المكونات الثابتة من البداية إلى النهاية لا تتغير ضمن الكتلة.
هنا يأتي دور LaCache، إطار العمل الرائد الذي يقدم تسريعاً دون الحاجة إلى تدريب جديد، حيث يساهم في تخفيف هذه المشكلة من خلال استخدام التخزين المؤقت بلا فقد (lossless caching) والدقة المختلطة. تعتمد LaCache على خوارزمية تتضمن تخزين ثلاث أنواع من النتائج الوسيطة:
1. **EmbedCache**: للتخزين المؤقت لنتائج الإيبدات.
2. **RoPECache**: لحالات الاهتمام المسبق على مستوى الرموز.
3. **FACache**: للإحصائيات اللينة في نموذج FlashAttention.
هذا التخزين المؤقت يمكّن النموذج من تخطي العمليات المتكررة على الرموز غير المتغيرة دون تغيير المخرجات. كما تتضمن LaCache استراتيجية تخفيض الدقة من نوع FP8 للمجموعات في الطبقات. هذه الاستراتيجية مُصممة لتتوافق مع توزيعات التنشيط التي تتغير عبر عملية الانتشار.
أظهرت التجارب أن استخدام LaCache بمفردها يحقق سرعة تصل إلى حوالي 1.3 مرة أسرع في معالجة البيانات مقارنة بالنموذج التقليدي. وعند دمجها مع طرق تسريع أخرى، يمكن أن تصل السرعة إلى 40.2 مرة دون التأثير على دقة النتائج. هناك تحول كبير في كيفية معالجة الذكاء الاصطناعي للنصوص، ومن المؤكد أن LaCache ستبقى في مقدمة الابتكار في هذا المجال.
لا كاش: تسريع دقيق لتقنيات الذكاء الاصطناعي مع تحسين الأداء
تقدم LaCache إطار عمل ثوري لتسريع نماذج اللغات الضخمة المبنية على الانتشار، مما يقلل من التكرار الحسابي بشكل كبير. يتميز بنهج سريع ودقيق للحفاظ على الكفاءة العالية في معالجة النصوص.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
