في ظل تطور تقنيات الذكاء الاصطناعي، برزت Diffusion Transformers (DiTs) كأداة رئيسية لإنتاج الفيديوهات عالية الجودة. ومع ذلك، كانت كفاءة التنفيذ تمثل مشكلة رئيسية بسبب استخدام الانتباه المكاني الزماني الكامل، الذي يعد مكلفًا حسابيًا ويتسبب في تأخير كبير في عملية الإنتاج.

يتناوب علماء الذكاء الاصطناعي بين عدة أساليب للتقليل من هذه التكاليف، ولكنها غالباً ما تواجه مشكلة عدم التوازن بين المرونة والكفاءة. الأساليب الحالية، وخاصة تلك التي تعتمد على قوالب محددة مسبقاً، تفتقر إلى القدرة على التكيف مع أنماط الانتباه المتنوعة. من ناحية أخرى، تعتمد الأقنعة التي يتم تحديدها أثناء التشغيل على أداء مكثف وغير اقتصادي.

أحد الاكتشافات الجديدة التي يمكن أن تغير هذه المعادلة هو تقنية Parameterized Stripe Attention (PSA). لقد ثبت أن الانتباه في DiT يظهر أنماطًا دورية على شكل خطوط مائلة في الأبعاد الزمانية والمكانية. وتمكن الباحثون من صياغة هذه الأنماط في نواة فعالة واحدة، مما يعد إنجازًا كبيرًا.

من خلال PSA، تم دمج الأنماط المختلفة في تمثيل موحد، مما سمح لنواة CUDA بكفاءة معالجة جميع الأنماط المتفرقة. وقد أظهرت التجارب أن PSA تحقق سرعة تنفيذ أعلى بنسبة 1.57 مرة و1.37 مرة مقارنة بالأساليب السابقة دون التأثير الكبير على جودة الصورة.

يبدو أن PSA قد تلبي احتياجات الصناعة من حيث السرعة والجودة، مما يمهد الطريق لأفكار جديدة في إنتاج محتوى الفيديو. هل ستكون هذه التقنية الشكل الجديد لإنتاج الفيديو في المستقبل؟