أحدثت نماذج تغير الفيديو طفرة في القدرة على معالجة الفيديوهات بدقة عالية بفضل تقنيات مثل Diffusion Transformers (DiTs). لكن التحدي كان دائماً في استهلاك الذاكرة الهائل، حيث يحتاج نموذج DiT الذي يزيد عن 100 مليار معلمة إلى أكثر من تيرابايت من الذاكرة المستمرة. وهذا يعيق الكثيرين عن القدرة على تعديل هذه النماذج الكبرى دون الاعتماد على مجموعات GPUs مكلفة.

في هذا السياق، جاء الابتكار الجديد المعروف باسم MegaSlide-DiT ليحل هذه الإشكالية. يتيح هذا النموذج التكيف مع DiT بحجم 105 مليار معلمة باستخدام GPU واحد من نوع H200 مع ذاكرة 1.5 تيرابايت. الفكرة الأساسية هي أن النموذج لا يحتاج إلى الوجود الفعلي على GPU، حيث تبقى جميع الأوزان المستدامة في الذاكرة المضيفة، بينما يتم نقل أجزاء مؤقتة إلى GPU حسب الحاجة.

ومن جهة أخرى، استبدل MegaSlide-DiT تقنية الانتباه العالمي التربيعي بتقنية جديدة تُسمى 3D Deformable Slide Attention (3D-DSA). تهدف هذه التقنية إلى تقليل تعقيد الذاكرة والعمليات الحسابية لتصبح خطية مقارنة بطول السلسلة، مما يجعل معالجة البيانات أكثر فعالية.

وتم نشر تقارير مفصلة تتعلق بتقييم الذاكرة وأداء تنفيذ النموذج، لتقديم دليل على كفاءة التصميم الجديد. بالرغم من أن MegaSlide-DiT لا يدّعي تدريب نموذج 105 مليار معلمة من الصفر على GPU واحد، إلا أنه يوفر مسارًا عمليًا لتكيف كامل المتغيرات في نماذج ضخمة لتغيير الفيديو على محطات عمل عالية الأداء. الأمر الذي يُعتبر خطوة هامة نحو مستقبل واعد في مجال الذكاء الاصطناعي.