في عالم الذكاء الاصطناعي، يمثل تجاوز التكاليف الحاسوبية لعالم نماذج اللغة متعددة الوسائط (MLLMs) تحديًا أساسيًا. حيث بات من الضروري مواجهة التعقيد الناتج عن معالجة التسلسلات طويلة التوكنات البصرية دون التأثير على الأداء.

تقديمًا لحل فعّال، تم تقديم تقنية جديدة تُعرف باسم SinkPruner، وهي إطار عمل مبتكر يتيح إزالة التوكنات البصرية الزائدة، مما يسهم في تحسين أداء النموذج بشكل ملحوظ. على الرغم من أن معظم الأساليب السابقة كانت تهدف إلى التخلص من التوكنات الزائدة، إلا أنها كانت تتجاهل عادةً التوكنات عالية التوزيع، والتي تحمل معلومات زائدة وغير ضرورية.

تأتي فكرة SinkPruner مستندة إلى اكتشاف أن تلك التوكنات العالية تمتاز بالاعتمادية المنخفضة في كلا البعدين: المميزات والمساحة. يعمل SinkPruner باستخدام تصميم تدريجي يتمحور حول مكونين رئيسيين؛ الأول هو "معقم بصري" يقوم بتصفية هذه التوكنات الزائدة قبل أن تتم معالجتها أكثر، والثاني هو "المخفف الموجه بالنص" الذي يحتفظ بالتوكنات المتوافقة مع ما هو مطلوب نصياً.

توضح التجارب الشاملة على مجموعة متنوعة من المقاييس، مما يشمل اثنا عشر دراسة لغوية بصريًا وأربعة دراسات فيديو لغوي، فعالية وكفاءة تقنية SinkPruner. তাقًا للنتائج، استطاعت الطريقة الحفاظ على 96.5% من أداء النموذج الأصلي LLaVA-1.5 تحت 89% من تقليل التوكنات، مما يبرز تميز وكفاءة هذه التقنية الجديدة.

إذا كنت مهتمًا بمزيد من الاستكشاف، فالأكواد المتاحة للجمهور على GitHub تسهل على الباحثين تطبيقها في أعمالهم الخاصة: GitHub SinkPruner.