تُعد نماذج اللغة والرؤية (Vision-Language Models أو VLMs) من أبرز التطورات في مجال الذكاء الاصطناعي، إذ تُستخدم في العديد من المهام متعددة الوسائط. ومع ذلك، تكشف الأبحاث عن تحدٍ كبير يواجه هذه النماذج يتمثل في فشلها في تقدير بعض المتغيرات السياقية الهامة، وهو ما نطلق عليه "التقدير المفرط للمتغيرات السياقية" (Contextual Variable Overestimation أو CVE).

تظهر هذه المشكلة بشكل واضح في التطبيقات الحقيقية مثل توقع تفضيلات الصور الإعلانية عبر أسواق جغرافية متنوعة. على سبيل المثال، عند الطلب من VLM اختيار بين صورتين لمنتج مخصصين لأسواق مختلفة، غالبًا ما تتجه النماذج نحو نتيجة ثابتة دون الالتفات للاختلافات الإقليمية. يحدث ذلك بسبب وجود إشارة قوية تهيمن على البيانات، مثل سمات المنتجات ومناطق الصور الكثيفة، مما يجعل المتغيرات الحرجة التي تعكس السياق السوقي تحت تأثير كبير.

لحل هذه المشكلة، تم جمع مجموعة بيانات جديدة تضم إعلانات حقيقية وأداء نقرها عبر عدة دول. وبدلاً من التقدير المفرط، قدم فريق البحث نموذج "GeoReward" الذي يعتمد على ثلاث آليات مخصصة: (1) تعزيز الاسترجاع الواعي للسوق، (2) تعديل بصري مدفوع بالسياق، (3) خسارة الحساسية الانتقائية.

علاوة على ذلك، أثبتت التجارب أن نموذج GeoReward لا يساعد فقط في معالجة مشكلة التقدير المفرط، بل يتفوق كذلك على النماذج الحالية. هذا العمل لا يكشف فقط عن انحياز منهجي في نماذج VLM نحو السمات الإدراكية السائدة، بل يقدم أيضًا حلاً مستهدفًا للتطبيقات التي يقوم فيها المتغيرات السياقية النادرة بتوجيه قرارات اتخاذ القرار. تعد هذه النتائج خطوة متقدمة نحو تحسين فعالية الإعلانات الرقمية، إذ ستساعد الشركات في تصميم محتوى إعلاني يراعي الفروقات السوقية بدقة.