ظهرت نماذج اللغات الكبيرة المُعتمدة على الانتشار (Diffusion Large Language Models - dLLMs) كبديل واعد للنماذج التقليدية المعتمدة على الاسترجاع التلقائي (Autoregressive - AR). حيث تتمتع هذه النماذج بقدرتها على إنشاء الرموز بشكل متزامن، مما يجعلها فعالة كنماذج مساعدة في الترميز التقديري (Speculative Decoding - SD)، حيث يمكنها إنتاج مجموعة كاملة من الرموز في خطوة واحدة فقط.
ومع ذلك، تعتمد الطرق الحالية في الترميز باستخدام الانتشار على أسلوب خطي في عملية الطرح، بالرغم من أن نماذج dLLMs تُصدر عدة رموز مرشحة عبر المواقع المختلفة، مما يؤدي إلى خلق مساحة شاملة من مسارات الترميز. هذا الاستخدام يرتب قيوداً على طول القبول وكفاءة الترميز.
لتعزيز الاستفادة من هذه البنية الحاملة لعدة مرشحات، تقوم فكرة PRESTO (الترتيب المتناغم للأشجار في الترميز التقديري للانتشار) بتطبيق طريقة بناء الشجرة على النماذج المستخدمة في الانتشار، مما يمكّن من استكشاف مسارات متنوعة للمرشحات.
ومع ذلك، تم اكتشاف أن الأسلوب البدائي لبناء الشجرة ليس الأمثل، حيث أن الفروقات في نماذج الانتشار لا تأخذ في الاعتبار الأسبقية، مما يؤدي إلى عدم تطابق مع عملية التحقق في أسلوب AR، ونتيجة لذلك، ترتيب المسارات يكون غير موثوق.
يسعى نموذج PRESTO بشكل مبدئي إلى سد هذه الفجوة من خلال تطوير النظام الخاص به حيث يجب أن يتوافق ترتيب المرشحات مع طبيعة التحقق المعتمدة على الأسبقية، كما يركز على بناء الشجرة لتوفير المسارات المرشحة التي تمتلك قدرة عالية على التحقق لزيادة طول القبول.
أظهرت التجارب الشاملة أن PRESTO يحقق زيادة ملحوظة في سرعة الأداء تصل إلى 1.5 مرة على نماذج الانتشار الحديثة المخصصة، وأيضاً 1.12 مرة على نماذج الانتشار التقديرية الذاتية عبر مجموعة متنوعة من الاختبارات.
في ضوء هذه التطورات المثيرة، كيف تعتقد أن PRESTO قد يؤثر على مستقبل نماذج اللغات بشكل عام؟ شاركونا آراءكم في التعليقات!
ثورة في نماذج اللغات: PRESTO يعيد رسم معالم الترميز التقديري!
تقدم PRESTO نموذجاً جديداً في عالم نماذج اللغات، مستفيداً من هيكل شجرة في الترميز التقديري. هذا الابتكار يعد بزيادة كفاءة الترميز بشكل كبير مقارنة بالنماذج التقليدية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
