يواجه الباحثون تحديات متعددة عندما يتعلق الأمر بالاستدلال باستخدام نماذج اللغة الكبيرة (Large Language Models) بسبب النمو الخطي لذاكرة الكاش (KV Cache) المرتبط بطول التسلسل. إنّ الأساليب الحالية التي تعتمد على تقليم (Pruning) العناصر تعاني من مشكلة كونها تعتمد على أهمية التوكنات (Tokens) لعينة محددة، مما يمنع إعادة استخدامها في الاستعلامات غير المرئية.
لكن مع ظهور تقنية TaskPress، نحصل على إطار عمل مبتكر يهدف إلى تحسين استخدام الذاكرة بطرق جديدة. بدلاً من تحسين الكاش لاستعلام واحد فقط، يقوم TaskPress ببناء تمثيل ذاكرة قابل لإعادة الاستخدام يعتمد على توجيه مهم عالي المستوى. يعمل هذا التوجيه كاستعلامٍ ميتا (Meta-Query) أثناء مرحلة التكوين للحد من التوكنات غير المتعلقة قبل صدور الاستعلامات في النهاية.
وبالإضافة إلى ذلك، يستفيد TaskPress من عوامل مقياس التكميم (Quantization Scale Factors) كإشارة تكلفة صفرية للكشف عن تمثيلات مؤثرة، مما يوفر وسيلة فعالة لتحديد أهمية التوكنات. أظهرت التجارب المنفذة على مهام متعددة مع إدخال سياقات طويلة أن TaskPress يمكنه بفاعلية إنشاء ذاكرة كاش مدمجة وقابلة لإعادة الاستخدام عبر استعلامات متنوعة، مما يحسن الأداء الكلي للنماذج.
ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون أنها ستغير من طريقة عمل نماذج اللغة الكبيرة في المستقبل؟ شاركونا آرائكم!
TaskPress: ثورة جديدة في ضغط ذاكرة الكاش غير المعتمدة على الاستعلامات
تقدم تقنية TaskPress حلاً مبتكراً لمشكلة استهلاك الذاكرة في نماذج اللغة الكبيرة عبر استخدام تقنيات التصفية الموجهة بالمهام. هذه الثورة التكنولوجية تعد بتحسين أداء النماذج وتوفير الذاكرة في مختلف الاستعلامات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
