تستمر نماذج اللغة الضخمة (Large Language Models) في تلبية احتياجات متزايدة، مما يجعل تكلفة الاستدلال التراكمية تحتل مكانة بارزة مقارنة بتكلفة التدريب لمرة واحدة. ونظرًا لاختلاف طبيعة كل مرحلة من مراحل الاستدلال، يكون الضغط على الأجهزة مختلفًا؛ إذ إن مرحلة ما قبل الملء (Prompt Prefill) تجرى بشكل متوازي وغالبًا ما تكون مرتبطة بالحسابات، بينما تعتمد مرحلة التشفير التلقائي (Autoregressive Decode) على تسلسلات تعتمد كثيرًا على عرض نطاق الذاكرة.
تسفر الأساليب التقليدية لتوسيع عرض نطاق النموذج أو عمقه عن زيادة التكاليف بشكل متزامن، حيث يتم تقييم كل طبقة مضيفة في كلتا المرحلتين. ولكن، هل يمكن إعادة تخصيص العمليات الحسابية التعلمية الإضافية لتكون لصالح توقع الاستمرار (Continuation Prediction)، دون التأثير على الحساب الرئيسي أو إلحاق ضرر بتخزين البيانات؟
وهنا تظهر تقنية تكنولوجيا Dual-Flow Transformer! تقوم هذه الخوارزمية الرائدة بتقسيم تدفقات المعلومات لضمان معالجة أفضل وأقل تكلفة. تستخدم تدفقها الرئيسي نموذج لغوي سببي كامل لمعالجة البيانات وكتابة ذاكرة القيم الرئيسية، بينما يُفعل التدفق المساعد (Auxiliary Flow) فقط بعد أن تتجاوز المعالجة بيانات النموذج الأولية، مما يضيف عمليات حسابية لتوقع الاستمرار دون التأثير على تدفق المعلومات الرئيسي.
تشاركم الأوزان والمصفوفات تعزز من فرصة إعادة استخدام الأوزان المفتوحة ومفاتيح القيمة خلال مهام التنفيذ المجمع. ومن خلال المقارنات بين الرموز المتطابقة، يظهر أن Dual-Flow تحقق خسارة تعليمية أقل عبر معمارية البيانات المختلفة. في نماذج الخبراء المتعددة (MoE)، تعطي الفصل في تدفقات الأدوات تحكمًا مستقلًا على تكاليف المطالب، وتكاليف الاستمرارية، وجودة التوقع.
لقد أجرينا دراسات شاملة حول حالتين: زيادة حسابات التفكيك مع الحفاظ على حسابات المملوء الثابتة، وإعادة تخصيص ميزانية حساب التشفير الثابتة بين التدفقات لتحسين التوقعات. تكشف هذه التجارب عن معادلات جودة ما قبل الملء وتشفير البيانات وتبرز إمكانيات تخصيص الموارد بناءً على الاحتياجات.
تحول ثوري في نماذج Transformers: تفكيك مسار ما قبل الملء عن حسابات التشفير الإضافية!
هل باتت نماذج اللغة الضخمة أكثر فعالية؟ الكشف عن تقنية Dual-Flow Transformers التي تعيد تعريف تكلفة الاستدلال وتحسين أداء النماذج! اكتشف كيف أحدثت هذه التقنية ثورة في طريقة معالجة البيانات.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
