في الآونة الأخيرة، برز نموذج DiffuMamba كابتكار ثوري في عالم نماذج اللغات القائم على تقنية الانتشار (Diffusion Language Models - DLMs). هذا النموذج يمثل بديلاً واعدًا للأنظمة التقليدية المستخدمة في التوليد الذاتي (Autoregressive Generation) التي تعتمد على هياكل الـ Transformer.
تتمثل المعضلة التي تواجه هذه النماذج في كفاءتها في عملية الاستدلال، إذ أنها تحتاج إلى وقت أكبر نتيجة للتركيز الرباعي الأبعاد أو تكاليف تخزين القيم. هنا يأتي دور DiffuMamba الذي تم تصميمه باستخدام هيكل Mamba الثنائي الاتجاه، مما يسهل نموذج التسلسل باستخدام إطار زمني خطي (Linear-Time Sequence Modeling).
قامت الأبحاث التي أجراها الفريق بمعالجة جوانب الأداء المختلفة للنموذج، بما في ذلك طرح نموذج DiffuMamba-H، وهو نسخة هجينة تحتوي على انتباه متداخل (Interleaved Attention). يبلغ عدد المعلمات لهذا النموذج نحو 1.3 مليار، مما يمكنه من منافسة النماذج المعتمدة على تقنية الانتشار المستخدمة على نطاق واسع.
الأهم من ذلك، أن DiffuMamba يسجل زيادة تصل إلى 8.2 مرة و4.3 مرة في كفاءة الاستدلال مقارنة بالنماذج التقليدية على التسلسلات الطويلة. يُظهر أيضًا تحليل شامل لكفاءة الاستدلال عبر مجموعة من نماذج DLM الحديثة، أن استعمال تقنية الانتشار بواسطة خلطات Mamba يحقق الأداء الأفضل، مما يفتح آفاق جديدة لنظم الجيل المبنية على الانتشار.
اكتشاف DiffuMamba: ثورة في نماذج اللغات بتقنية الانتشار!
قدم فريق من الباحثين نموذج DiffuMamba كبديل واعد للنماذج المعتمدة على التوليد الذاتي، محققًا كفاءة عالية في الاستدلال. يتميز هذا النموذج بكونه مبنيًا على هيكل Mamba الثنائي الاتجاه، مما يعزز أداءه بشكل كبير.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
