أعلنت دراسات جديدة عن أسلوب مبتكر يُسمى "MWOP"، والذي يهدف إلى تعزيز الكفاءة التشغيلية لنماذج اللغة متعددة الوسائط (MLLMs). في عالم الذكاء الاصطناعي، تعتبر هذه النماذج محورية لكن تكلفتها العالية في معالجة تسلسلات الصور والنصوص الطويلة تشكل تحدياً كبيراً.
حتى الآن، كانت تقنيات ضغط العمليات تركز بشكل رئيسي على تقليص الفائض بين مستويات النماذج، دون النظر إلى التفاصيل الفرعية الدقيقة التي تجعلها أكثر فعالية. لكن عملية MWOP تنظر بعمق إلى مسارات التفاعل بين النصوص والمرئيات، وتحدد الفائض في عمليات الانتباه (attention) وآليات الشبكات العصبية المرافقة.
من خلال تقنيات مبتكرة، تعمل MWOP على تصفية مسارات الانتباه لكل طبقة على حدة بين المدخلات المرئية والنصية. وبتطبيق معيار تايلور من الدرجة الأولى، يصبح بإمكان الباحثين إجراء تقييم جديد لأهمية القنوات بعد تنفيذ عمليات الترشيح.
نتائج التجارب على نموذج "LLaVA-OneVision-7B" أظهرت أن MWOP تُحقق تسريعاً قدره 1.6 مرة مع الاحتفاظ بمتوسط أداء يصل إلى 99.7% عبر 12 معياراً مختلفاً. وعند دمجها مع تقنيتين ل compressing tokens، يتزايد هذا التسريع ليصل إلى 2.9 و2.7 مرة على التوالي.
من خلال تطوير "Triton Attention Kernels" وعمليات التنفيذ المرن للنماذج المرئية، يُظهر هذا الأسلوب كيفية تحسين معالجة البيانات الضخمة وتقليل التكاليف مع تعزيز الأداء. إذا كنت مهتماً بالتكنولوجيا الحديثة، تحقق من الكود المتوفر على GitHub وشاركنا برأيك حول هذه التطورات المبهرة!
ثورة في أداء نماذج اللغة متعددة الوسائط: طريقة جديدة لتحقيق كفاءة مدهشة!
تم الكشف عن أسلوب جديد يدعى MWOP يعمل على تحسين أداء نماذج اللغة متعددة الوسائط (MLLMs) بشكل ثوري. هذا الأسلوب يعد بتسريع عمليات المعالجة مع الحفاظ على جودة الأداء، مما يوفر تكاليف كبيرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
