في عالم الذكاء الاصطناعي، أصبح توليد الفيديو باستخدام النماذج المعالجة أمرًا شائعًا، ولكن تظل التكلفة العالية للعينات تمثل تحديًا كبيرًا. مع استخدام تقنية الانتباه النمطي (Attention) خلال كل خطوة تصحيح، ترتفع الكلفة بشكل واضح كلما زادت دقة الفيديو ومدته. هنا تأتي تقنية LoSA (Near-Lossless Sparse Attention) لتعكس الوضع القائم.
تستهدف LoSA الحد من التكلفة المرتبطة بالتوليد دون الحاجة إلى إعادة التدريب على النماذج، وتأتي ببصمة جديدة في مجال تسريع معالجة الفيديو. تقدم هذه الطريقة تخفيضًا غير تقليدي حيث تبقي على جودة الأداء قريبة من المثالية - حفظ نسبة 99% من تفاعلات الانتباه.
بفضل ملاحظتين رئيسيتين، توفر LoSA إمكانية تطبيقها بشكل عملي: يمكن إزالة حوالي 40% من التفاعلات بين الكتل واستمرار الاحتفاظ بنسبة 99% من كتلة الانتباه، كما أن الدعم العالي الكتلة يتبقى ثابتًا عبر خطوات التنظيف.
عند تجربتها على نماذج Video Diffusion مثل Wan2.1-1.3B، أثبتت LoSA قدرتها على تحقيق زيادة في السرعة بنسبة 1.36 مرة مع انخفاض ضئيل بلغ 0.06 نقطة في علامة الأداء العامة. ثم تم دمجها مع تقنيات تخزين الميزات، مما زاد السرعة إلى 3.2 مرة على نموذج HunyuanVideo مع انخفاض بسيط قدره 0.02 نقطة.
أثبتت LuSA تأثيرها الإيجابي عبر ثلاث نماذج مختلفة من تحويل الفيديو، مما يمهد الطريق لتوجهات جديدة في سرعة معالجة المحتوى المرئي دون التضحية بالجودة.
إعادة تعريف سرعة توليد الفيديو: طريقة LoSA لتسريع النماذج بذكاء اصطناعي متقدم
تقدم طريقة LoSA تقنية جديدة تسهم في تسريع توليد الفيديو باستخدام نماذج تحويل الفيديو بذكاء اصطناعي. هذه التقنية تضمن الحفاظ على جودة الأداء من خلال تقليل تكاليف المعالجة، مما يجعلها خطوة مبتكرة في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
