تعتمد نماذج اللغة متعددة الوسائط (MLLMs) بشكل رئيسي على آلية الانتباه لتحقيق نجاحاتها. لكن، هناك جوانب خفية تزعم أن تأثير هذه الآلية يمكن أن يؤدي إلى مشكلات غير مرئية. فإلى جانب النجاح في الأداء، تظل نماذج MLLMs تعاني من انحيازات هيكلية تؤدي إلى تشتت الانتباه نحو رموز بصرية غير مهمة، مما يعرف بظاهرة "سجلات" أو "أحواض الانتباه البصرية".

تتمثل الفكرة الرئيسية في أن انحيازاً هيكلياً مزمناً يقوم بتقليل الإشارة البصرية الدلالية، مما يعزز ظهور الهلوسات متعددة الوسائط، حيث يتفوق النموذج على التفضيلات اللغوية بدلاً من الأدلة البصرية الصحيحة.

لمعالجة هذه المشكلة المعقدة، تم تقديم تقنية جديدة تدعى "التنقية-guided purifcation وتوزيع الانتباه التكيفي" (SPAR). هذه التقنية لا تتطلب تدريبًا جديدًا، بل تعمل كحل إضافي (plug-and-play) لتحسين توزيع الانتباه من خلال تنقية الضوضاء الهيكلية وإعادة توزيع الميزانية الاعتبارية نحو المناطق البصرية الأكثر إفادة.

أظهرت التقييمات الشاملة عبر مجموعة متنوعة من معايير الهلوسة أن SPAR تعمل بكفاءة عالية، وتعيد الأساس البصري الأصيل مع تكلفة حسابية ضئيلة. هذه الإنجازات تفتح أفقاً جديداً لفهم كيفية تعزيز دقة نماذج اللغة متعددة الوسائط وتحقيق نتائج أفضل.