تتقدم تقنية نماذج اللغة المرئية (Vision-Language Models) بسرعة، مقدمة إمكانيات استدلال بصرية استثنائية. لكن مع تزايد عدد الرموز المرئية، ترتفع تكاليف الاستدلال بشكل كبير. هناك مشكلتان رئيسيتان تعاني منهما طرق معالجة الرموز المرئية الموجودة. أولاً، تعمل معظم هذه الطرق بعد مرحلة الترميز البصري، مما يترك مرحلة الترميز غير محسّنة، وبالتالي تُركّز على تقليل زمن الحساب.

ثانياً، تحت قيود صارمة على عدد الرموز، غالباً ما تفشل طرق الموازنة في الحفاظ على السياقات البصرية الشاملة والتفاصيل الدقيقة، مما يؤثر سلباً على الأداء.

لتجاوز هذه التحديات، نقدم PACE (Pixel-Adaptive Condense and Extract)، وهو إطار عمل خاص بالاستدلال دون الحاجة للتدريب، ويعزز كل من الترميز البصري ونموذج اللغة الكبير (Large Language Model) من خلال مفهوم مشترك للتكثيف والاستخراج.

خلال مرحلة التكثيف، يقوم ضاغط البكسل التكيفي (Adaptive Pixel Compressor) بتقييم كثافة المعلومات البصرية قبل الترميز، مما يتيح تقليل المدخلات الزائدة وتخفيض وقت حساب الترميز مع الحفاظ على السياق العام والإشارات البصرية الهامة.

وفي مرحلة الاستخراج، يحتفظ المستخرج الديناميكي ثنائي الانتباه (Dynamic Dual-Attention Extractor) بالرموز المرئية المختارة من خلال دمج الإشارات البصرية الداخلية من الترميز والإشارات الدلالية من النموذج اللغوي، مما يحفظ التفاصيل الحرجة للمهام المدروسة.

عند دمج PACE مع نموذج Qwen2.5-VL-7B، يبقى أداء النموذج 93.8% من أدائه الأصلي، مع استخدام فقط 10% من الرموز المرئية، مما يُحقق تسريعاً بمقدار 3.1 مرة في زمن ظهور أول رمز (Time to First Token). لمزيد من التفاصيل، يمكنك الاطلاع على الكود المصدري المتاح على GitHub.