تتزايد الحاجة إلى حلول فعالة لتحسين أداء نماذج اللغة والرؤية (Vision-Language Models أو VLMs) في عصر تتطلب فيه التطبيقات استخدام صور عالية الدقة. إلا أن هذا يرفع بشكل كبير من تكاليف الاستدلال بسبب زيادة طول تسلسل الرموز البصرية. هنا تأتي تقنية StackTok كابتكار ثوري يعد بتقليل هذه التكاليف دون الحاجة إلى إعادة تدريب النماذج.

تعمل StackTok على اختيار مجموعات رمزية مضغوطة تُعطي أولوية لتناغم الاستعلام (query relevance) وتغطية الصورة (visual coverage). ويتغير التوازن المثالي بين هذين الأمرين باختلاف الاستفسارات والميزانيات الرمزية. الأسئلة المحددة تحتاج إلى تركيز أكثر على الدقة، بينما الأسئلة العامة تطلب تغطية بصرية أوسع.

تتميز StackTok بكونها مُحددًا خالياً من التدريب، حيث تُعالج تناغم الاستعلام كهدف رئيسي وتستخدم التغطية البصرية لدعم الميزانية. تقوم StackTok ببناء مرجع تغطية مصنف حسب الحجم وتعدل هدف الدعم الخاص بها باستخدام انتروبيا تناغم الاستعلام والرؤية. كما تُنفذ سياسة اختيار متداخلة تُبرز التركيز على إضافة رموز تتناسب مع الاحتياجات الحالية للمجموعة.

عند معالجة مدخلات ذات دقة عالية، تخصص StackTok ميزانية رمزية موحدة عبر المحاصيل (crops) استنادًا على المردود الهام للرموز المسموح بها. وقد تم تقييم أدائها باستخدام خمسة نماذج VLMs عبر عشرة معايير مختلفة لفهم الصورة، حيث أثبتت StackTok أنها تتصدر قائمة المُحددات الخالية من التدريب في جميع إعدادات النماذج والميزانيات المختبرة. على نموذج LLaVA-NeXT-7B عالي الدقة، احتفظت StackTok بـ95.26% من أداء كامل الرموز مع استخدام 160 من أصل 2880 رمزًا بصريًا (5.6%).

بفضل تقنية StackTok، يبدو أن تجاهل الرموز غير اللازمة أصبح ممكنًا دون المساس بجودة الأداء. فهل سنرى المزيد من الابتكارات في هذا الاتجاه في المستقبل القريب؟ شاركونا آراءكم!