تُعتبر نماذج اللغات الكبيرة متعددة الوسائط (Multimodal Large Language Models) السائدة في مجال فهم الصور، إلا أن لديها تكلفة مرتفعة نتيجة ترميز المدخلات إلى رموز ثابتة وكثيفة. يعتبر توزيع المعلومات البصرية غير متساوٍ، حيث تتطلب بعض المناطق تفاصيل دقيقة بينما يمكن أن تتحمل أخرى تمثيلات مضغوطة. إن تقليل جودة المحتوى قد يحرم هذه التفاصيل، في حين أن الطرق الحالية لتقليص الرموز تظل محدودة من حيث التكيف مع المحتوى وتعميم المهام.

للتغلب على هذه القيود، تم تقديم نموذج VisionWeave الذي يتضمن إمكانية الدمج المرن للتمثيلات البصرية، حيث يتمكن النموذج من تحديد في أي مكان يجب تخصيص التفاصيل البصرية ومدى تلك التفاصيل.

تتكون VisionWeave من مكونين رئيسيين: مسبار مكاني مُغلق يقوم بإنشاء تمثيلات خشنة، إلى جانب تمثيلات دقيقة ضمن تنسيق مشترك، بينما يتعلم جهاز توجيه الدقة كيفية تخصيص هذه التمثيلات بناءً على المحتوى. إذ أثبت النموذج كفاءته من خلال تدريب واسع النطاق واستخدام نموذج Qwen3.8-27B، مما يساعد في تقليل الرموز بنحو 43% مع الاحتفاظ بمعدل أداء يبلغ 98.9%.

عند تطبيق VisionWeave على محرك SGLang، حققنا زيادة في الإنتاجية بنسبة 2.3 مرة بتقليل زمن النقل ووقت محطة النقل بشكل كبير. هذه النتائج تجعل من الممكن اعتبار الدمج المرن للتمثيلات البصرية قدرة واعدة للنماذج متعددة الوسائط من الجيل القادم.