في عالم الذكاء الاصطناعي، يبدو أن الأساليب التقليدية لتقييم نماذج اللغة البصرية (VLM) لم تعد كافية. حيث تكشف دراسة جديدة بعنوان "استكشاف فعالية حواجز السلامة البصرية" عن نتائج مثيرة تتعلق بكيفية حكم VLM على النصوص الموجودة على الشاشة ومدى توافقها مع التعليمات المقدمة. تمثل هذه الدراسة تحولًا جذريًا في كيفية فهمنا لكفاءة هذه الأنظمة، حيث تقدم أداة جديدة تُعرف باسم Mind2Web-Injection.

تعتمد Mind2Web-Injection على مجموعة بيانات تتضمن 9,954 زوجًا من التعليمات ولقطات الشاشة المرتبطة بها، مع وضع علامات دقيقة لكل عنصر. من خلال تحليل هذه البيانات، وُجد أن هناك اختلافات كبيرة في قدرة النماذج على الكشف عن الأخطاء. على سبيل المثال، نموذج Qwen3-VL-32B، الذي يعتبر من أقوى النماذج المفتوحة، تمكن من تحديد حالات الفشل بشكل صحيح في 58.7% من الحالات، بينما نموذج GPT-5.6-luna حقق نسبة دقة مذهلة تصل إلى 99.9%.

للمساعدة في تحسين أداء هذه النماذج، تقدم الدراسة أيضًا تدخلات تدريبية جديدة لا تتطلب إجراء تغييرات جذرية على النماذج الحالية، مثل ReadGate الذي يعمل على تحسين ربط التعليمات دون تغيير النتائج، وCmdCompare الذي يختبر إذا كان المقارنة الواضحة بين التعليمات يمكن أن تحلّ inconsistencies.

تسهم هذه النتائج في تعزيز أهمية استخدام أساليب تقييم أكثر شمولية، تتضمن دقة الحكم، تحديد موقع الأدلة، واستجابة counterfactual بشكل منفصل.