في خطوة جديدة نحو تطوير نماذج اللغة، تم تقديم تقنية Hybrid Latent Attention (HLA) التي تمثل ثورة في طريقة معالجة البيانات. تعمل نماذج اللغة التقليدية، المعروفة بتطبيقها نفس المجموعة من الطبقات عدة مرات (T) لكل توكن (token)، على تعميق النموذج دون إضافة معلمات جديدة، ولكنها تزيد في الوقت نفسه من حجم ذاكرة المفتاح والقيمة (KV cache) وفقًا لعدد مرات التكرار، مما يؤدي إلى تقليل الكفاءة في معالجة البيانات.
تقنية HLA تم تصميمها لحل هذه المشكلة من خلال الاحتفاظ بالمفاتيح والقيم الدقيقة ضمن نافذة متحركة من التوكنات الحديثة، مما يعني تجميع كل توكن قديم بشكل مكثف بحيث يمكن استدعاؤه دون الحاجة لإعادة تشكيل المفاتيح والقيم. تم التطبيق العملي لهذه التقنية عبر تدريب HLA على نماذج Ouro المتكررة والتي تحتوي على 1.4 مليار و2.6 مليار معلمة.
من خلال هذا التدريب، تم تقليص حجم الذاكرة المؤقتة بمعدل 10.7 مرة لكل توكن، مما أتاح إمكانية معالجة ما بين 4.0 إلى 8.8 مرة من التتابعات في الوقت نفسه لكل وحدة معالجة رسومية (GPU). نتائج هذا التطور كانت مبهرة، حيث تحسن سرعة المعالجة بمرتين ونصف عند السياقات التي تصل إلى 1K توكن وبما يصل إلى 7.4 مرات عند 16K. تم الاحتفاظ بدقة تتجاوز 97% في المعايير الرياضية والمعرفية والقياسية، و96-100% في استرجاع السياقات الطويلة. بعد الانتهاء من التعديل الدقيق، كان أداء النموذج الجديد مشابهاً للأصل الذي تم تحسينه، مما يدل على قدرته العالية في المنافسات المتقدمة.
لا شك أن تقدم HLA يمثل خطوة هامة نحو تحقيق كفاءة أعلى في معالجة نماذج اللغة، مما يسهم في تعزيز أداء الذكاء الاصطناعي في عدة مجالات.
ما رأيكم في هذا التطور التكنولوجي؟ شاركونا في التعليقات!
ابتكار مذهل: تقنيات Hybrid Latent Attention تجعل نماذج اللغة أكثر كفاءة!
تمثل تقنية Hybrid Latent Attention (HLA) قفزة نوعية في نماذج اللغة، حيث تقلل من حجم الذاكرة المؤقتة وتزيد من سرعة معالجة البيانات. هذا الابتكار يعد بأداء مذهل مع الحفاظ على دقة عالية في النتائج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
