في عالم الذكاء الاصطناعي، تلعب نماذج اللغة متعددة الأنماط (MLLMs) دوراً مهماً، لكن مع تزايد حجم البيانات البصرية المُعالجة، تزداد الحاجة إلى تقنيات جديدة لتحسين الكفاءة. من هنا، تبرز تقنية AdaVSkip، التي تعتمد على مبدأ رئيسي: تعديل مسارات معالجة الرموز البصرية عبر طبقات النموذج لتحقيق أقصى استفادة من الحسابات.

تستخدم AdaVSkip نظاماً ذكياً من الموجهات الخفيفة التي تقوم بتقييم كل رمز بصري، مما يتيح للنموذج اختيار ما إذا كان يجب معالجته أو تخطيه عبر طبقات الانتباه الذاتي (self-attention) وMLP. هذه العملية ليست فقط جيدة من حيث الكفاءة، بل توفر أيضاً أداة مرنة للتكيف مع مختلف المدخلات.

لمعالجة التحديات المتعلقة بتعلم مسارات المعالجة، تقترح تكنوكوجيا AdaVSkip إطار تدريب ثنائي المراحل. المرحلة الأولى تركز على إعداد سياسة توجيه أولية باستخدام تدريب تحت إشراف مع أهداف محددة. بعد ذلك، تأتي المرحلة الثانية التي تعتمد على التعلم المعزز لتحسين عمليات التوجيه اعتماداً على نتائج الأداء.

تم اختبار هذه التقنية مع ثلاثة نماذج خلفية مختلفة، وفي حالة نموذجي LLaVA-NeXT-7B، استطاعت AdaVSkip تقليل FLOPs بنسبة تصل إلى 53.2% مع الحفاظ على مستوى أداء النموذج الأصلي. وعند دمجها مع ضغط الرموز البصرية، زادت هذه النسبة إلى 91.2%، مع الحفاظ على 97.2% من دقة الأداء الأصلي.

باختصار، تُظهر AdaVSkip كيف يمكن للتقنيات الحديثة في معالجة البيانات أن تُحدث ثورة في طريقة تفكيرنا في الذكاء الاصطناعي، وتمثل خطوة كبيرة نحو زيادة كفاءة النماذج بدون التضحية بالأداء.