في عالم تكنولوجيا الذكاء الاصطناعي، تبرز نماذج تحويل النصوص إلى صور (text-to-image models) كأحد الابتكارات الأكثر إثارة، حيث تتمكن هذه النماذج من إنتاج صور بجودة لا مثيل لها. لكن السؤال الذي يطرح نفسه هو: كيف يمكننا تسريع هذه العمليات دون المساس بجودة الصور؟ هنا يأتي دور DC-Gen، الإطار المبتكر الذي يقدم حلولاً جديدة لمشكلات كفاءة النماذج.

على الرغم من الجهود السابقة لتسريع نماذج التحويل، إلا أن معظم الأبحاث تغفل معالجة الفائض الكامن داخل المساحات الكامنة، مما أحدث ثغرة في الأداء. لكن DC-Gen يتجاوز هذه العقبة من خلال استخدام مساحة كامن مضغوطة بشكل عميق.

بدلاً من اعتماد منهجية مكلفة تعتمد على إعادة تدريب النموذج من الصفر، يعتمد DC-Gen على خطوط أنابيب تدريب فعالة بعد التدريب للحفاظ على جودة النموذج الأساسي. يركز البحث على معالجة الفجوة في التمثيل بين المساحة الكامنة للموديل الأساسي ومساحة كامن مضغوطة بشكل عميق، مما يمنع عدم الاستقرار أثناء تحسين النموذج.

يتم ذلك عبر تدريب تمهيدي يتماشى بين التمثيلات، ما يجعل عمليات الضبط الخفيف باستخدام LoRA (Low-Rank Adaptation) كافية لاستعادة جودة إنتاج النموذج.

التجارب التي أجريت على نماذج SANA وFLUX.1-Krea أثبتت فعالية DC-Gen، حيث حقق نموذج DC-Gen-FLUX تقليصاً في زمن إنتاج الصورة بدقة 4K بنسبة 53 مرة عند استخدام وحدة معالجة الرسومات NVIDIA H100. ومن المذهل أنه عند الدمج مع NVFP4 SVDQuant، يمكن لـ DC-Gen-FLUX إنتاج صورة بدقة 4K في 3.5 ثانية فقط، مما يسجل تقليصاً عاماً بقدر 138 مرة مقارنة بنموذج FLUX.1-Krea الأساسي.

لمعرفة المزيد، يمكنكم زيارة مشروع DC-Gen على موقع GitHub هنا. هل أنتم متحمسون لرؤية التطبيقات العملية لهذه التقنية؟ شاركونا آرائكم في التعليقات!