في عالم أنظمة التوليد المعزز بالاسترجاع (Retrieval-Augmented Generation - RAG)، يتم جمع عدد كبير من القطع المسترجعة لتشكيل سياق المدخلات، مما يتيح للمستخدمين الحصول على ردود عالية الجودة تستند إلى المعرفة الخارجية. ومع ذلك، هذا التزايد الكبير في طول سياق المدخلات يسبب زيادة في عبء العمل المتعلق بالتهيئة الأولية (prefill workload) ويؤدي إلى زمن أطول أول توكن (Time to First Token - TTFT).
قد اقترحت الأبحاث السابقة تقنيات فعالة لإعادة استخدام ذاكرات المفاتيح والقيم (Key-Value Caches) الجاهزة، لكن يبقى من غير الواضح إذا ما كانت جودة الردود ستظل محفوظة عندما يصبح سياق المدخلات طويلاً للغاية. في هذه الورقة العلمية، نقدم نهجاً مدمجاً يأخذ بعين الاعتبار تحسين النموذج مع وضع تجمعات ذاكرات المفاتيح والقيم في الاعتبار، مع إعادة حساب انتقائية لجزء من تلك الذاكرات.
من خلال تطبيق كلا الطريقتين، يظهر تحليلنا تحسناً ملحوظاً في الدقة للمدخلات الطويلة. وقد أظهرت التجارب على معيار RULER أن من أجل مدخل مكون من 124,000 توكن، يحسن منهجنا الدرجات بمقدار 9.7 نقطة مقارنة بالأسلوب التقليدي الذي يعيد حساب ذاكرات KV فقط. بالإضافة إلى ذلك، تم تقليل زمن TTFT بنسبة 80% مقارنةً بالاعتماد على الانتباه الكامل.
هذا يمثل تطورًا مثيرًا في طريقة عمل أنظمة الذكاء الاصطناعي، ويفتح آفاقًا جديدة في تحسين الأداء وزيادة الكفاءة. ما رأيكم في هذه الابتكارات المتطورة؟ هل تعتقدون أنها ستحدث تحولاً في طريقة استخدامنا للذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!
ابتكار مذهل في نماذج الذكاء الاصطناعي: هل نحتاج لتحسينات KV Cache أم إعادة حسابها؟ لماذا لا نستخدم كلا الطريقتين؟
تقدم دراسة جديدة نهجاً مدمجاً لتحسين نماذج الذكاء الاصطناعي في أنظمة التوليد المعزز بالاسترجاع. يستخدم هذا النهج تحسينات KV Cache مع إعادة حساب جزئي، ما يؤدي إلى تحسين الدقة وتقليل زمن الانتظار بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
