تتطور نماذج الرؤية واللغة (Vision-Language Models) بشكل سريع، ولكنها تواجه تحديات كبيرة تتعلق بتكاليف الاستدلال التي تنجم عن العدد الكبير من الرموز البصرية. في هذا السياق، تطلق TReVS (نظام جديد لتحسين أداء نماذج الرؤية واللغة) نهجاً ثورياً يجمع بين الصلة النصية (Textual Relevance) والوضوح البصري (Visual Saliency).

يساعد TReVS على إحداث تغيير جذري في كيفية معالجة الرموز البصرية من خلال عملية متطورة تتكون من مرحلتين. الأولى تتعلق بإزالة الرموز الزائدة بصرياً بعد وحدة تقديم الرؤية، بينما المرحلة الثانية تعتمد على سياسة نصية داخل نموذج اللغة الكبير (Large Language Model). ومع ذلك، الاعتماد على الوضوح البصري فقط قد يؤدي إلى إزالة الرموز المهمة التي ترتبط بالاستفسارات النصية، مما يؤثر سلباً على الأداء لاحقاً.

من خلال سلسلة من التحليلات التجريبية، أظهرت النتائج أن دمج توجيه الاستفسار في المرحلة الأولى يعزز بشكل ملحوظ الاحتفاظ بالأدلة المهمة للمهام, مما يوفر أداء أفضل. ووجد الباحثون أيضاً أن رؤوس الانتباه عالية التباين تُظهر حساسية أكبر للاستفسارات النصية، مما يُنتج إشارات انتباه أكثر تمييزاً بين النص والرؤية للمرحلة الثانية.

بناءً على هذه الاستنتاجات، يتمكن نظام TReVS من تيسير عملية إزالة الرموز الغير هامة من النماذج، مما يؤدي إلى تحسين الأداء. وعند اختباره على نموذج LLaVA-1.5-7B، تمكن TReVS من الحفاظ على 92.8% من أداء النسخة الأصلية غير المدروزة مع التخلص من 94.4% من الرموز البصرية، متفوقاً بذلك على أفضل الأساليب الحالية. إنه بالفعل إنجاز غير مسبوق في عالم نماذج الرؤية واللغة.

ماذا عنكم؟ هل تعتقدون أن TReVS ستحول طريقة تعاملنا مع النماذج اللغوية والرؤية؟ شاركونا آراءكم!