في عالم الذكاء الاصطناعي، تظل مسألة ما إذا كانت أوزان الانتباه تعكس بصدق عمليات تفكير النموذج هي مسألة مثيرة للجدل، خصوصاً في سياق نماذج اللغة-رؤية (VLMs). هذا الجدل يستمر وجوده على مستوى الفهم البصري، وهو ما تناولته دراسة حديثة تتعمق في تحليل كيفية معاملة نماذج VLMs لأوزان الانتباه المرئي.

المؤلفون استخدموا تحليل الاضطراب السببي لدراسة تلك النماذج الحالية، حيث أظهروا تباينًا ملحوظًا في عملية أمان الانتباه، متمثلة في ثلاثة أنماط مختلفة:

1. **النمط الموثوق - الكافي (Faithful-Sufficient)**: حيث تكون أوزان الانتباه العليا ضرورية وكافية للتنبؤ.
2. **النمط الموثوق - الموزع (Faithful-Distributed)**: حيث تكون الأوزان ضرورية ولكنها تحتاج إلى سياق بصري أوسع.
3. **النمط غير المركز (Non-Focal)**: حيث لا تكون هناك منطقة انتباه محلية ضرورية، ولكن المعلومات البصرية تظل تحفز التنبؤ.

علاوة على ذلك، كشفت التحليلات أن المناطق التي تم تحديدها من قبل البشر تلبي الشمولية في حوالي 60% من الحالات مقارنة بتصنيفات نماذج الانتباه، مما يجسد الفجوة النظامية بين اعتماد النموذج على الصورة وحدس البشر.

تظهر هذه الأنماط بوضوح عبر المهام العامة للتحليل البصري (VQA) والمهام الوثائقية مثل VRDU وChartQA، مما يشير إلى أن أمان الانتباه البصري يختلف بناءً على متطلبات المعالجة وهياكل النماذج، وليس بشكل موحد.

تعتبر هذه النتائج خطوة هامة نحو فهم أعمق لكيفية تفاعل نماذج الذكاء الاصطناعي مع البيانات المرئية وتقديم استجابات أفضل وأدق في المستقبل.