أعلنت دراسات جديدة عن أسلوب مبتكر يُسمى "MWOP"، والذي يهدف إلى تعزيز الكفاءة التشغيلية لنماذج اللغة متعددة الوسائط (MLLMs). في عالم الذكاء الاصطناعي، تعتبر هذه النماذج محورية لكن تكلفتها العالية في معالجة تسلسلات الصور والنصوص الطويلة تشكل تحدياً كبيراً.

حتى الآن، كانت تقنيات ضغط العمليات تركز بشكل رئيسي على تقليص الفائض بين مستويات النماذج، دون النظر إلى التفاصيل الفرعية الدقيقة التي تجعلها أكثر فعالية. لكن عملية MWOP تنظر بعمق إلى مسارات التفاعل بين النصوص والمرئيات، وتحدد الفائض في عمليات الانتباه (attention) وآليات الشبكات العصبية المرافقة.

من خلال تقنيات مبتكرة، تعمل MWOP على تصفية مسارات الانتباه لكل طبقة على حدة بين المدخلات المرئية والنصية. وبتطبيق معيار تايلور من الدرجة الأولى، يصبح بإمكان الباحثين إجراء تقييم جديد لأهمية القنوات بعد تنفيذ عمليات الترشيح.

نتائج التجارب على نموذج "LLaVA-OneVision-7B" أظهرت أن MWOP تُحقق تسريعاً قدره 1.6 مرة مع الاحتفاظ بمتوسط أداء يصل إلى 99.7% عبر 12 معياراً مختلفاً. وعند دمجها مع تقنيتين ل compressing tokens، يتزايد هذا التسريع ليصل إلى 2.9 و2.7 مرة على التوالي.

من خلال تطوير "Triton Attention Kernels" وعمليات التنفيذ المرن للنماذج المرئية، يُظهر هذا الأسلوب كيفية تحسين معالجة البيانات الضخمة وتقليل التكاليف مع تعزيز الأداء. إذا كنت مهتماً بالتكنولوجيا الحديثة، تحقق من الكود المتوفر على GitHub وشاركنا برأيك حول هذه التطورات المبهرة!