تأتي تقنية DIET لتكون بمثابة تحول جديد في عالم نماذج التحويل للفيديو (Video Diffusion Transformers). حيث تسعى هذه النماذج دائمًا إلى تحسين كفاءة الأداء وتقليل تكلفة التخزين. وتعتمد هذه التقنية المبتكرة على استخدام نماذج مختلطة من الخبراء (Mixture-of-Experts) لتقليل العمليات الحسابية النشطة، إلا أن تخزين الخبراء بالكامل لا يزال مكلفًا. لذا، طورت DIET إطار عمل جديدًا لقص الخبراء دون الحاجة إلى التدريب، مما يجعل الأمر أكثر سهولة وفعالية.

تعمل تقنية DIET من خلال استجابات الحذف، حيث تقوم بتسجيل مخرجات الخبراء وحالات أجهزة التوجيه خلال مرحلة التهيئة مع جميع الخبراء. من خلال استعراض الحذف المحتمل من المخرجات المخزنة، لا تحتاج التقنية إلى عمليات تمرير إضافية للنموذج، مما يوفر الوقت والموارد. يتميز كل خبير بتوقيع خاص به للأسد، والذي يحدد التغييرات الناتجة عند إزالته من العملية.

عبر تقنية DIET، يتم اختيار الخبراء المحفوظين من خلال تقليل فقدان التنوع الكلي (Overall Diversity Loss)، مما يساعد على الحفاظ على التغطية الاتجاهية في فضاء التوقيع. يتم دمج البحث المحلي بين الطبقات مع البحث المدعوم بالتراجع عبر الطبقات؛ لضمان توزيع الخبراء بشكل متوازن بعد القيام بعملية التقليص.

وفي حالة استخدام نموذج LingBot-Video 30B-A3B، أدى تقليص 50% من الخبراء إلى تقليل حجم بيانات التخزين من 57 جيجابايت إلى 30 جيجابايت، مما جعل من الممكن نشر النموذج على بطاقة GPU بحجم 48 جيجابايت دون الحاجة إلى تعديل النموذج. وقد أظهرت تقنية DIET تحسنًا مستمرًا مقارنة بمنهجيات التقليص التقليدي المعتمدة على نماذج اللغات الكبيرة (Large Language Models).

باختصار، تمثل تقنية DIET خطوة مهمة في جعل نماذج التحويل الخاصة بالفيديو أكثر كفاءة وأقل تكلفة. ما رأيكم في هذا التطور المثير؟ شاركونا في التعليقات!