تشهد نماذج اللغة المرئية (Vision-Language Models) نجاحًا ملحوظًا في مهام بصرية متنوعة، ولكن أدائها يتراجع في البيئات البصرية المعقدة. قد تعتمد الطرق الحالية لتعزيز الأداء على تدريب إضافي أو أدوات تقسيم خارجية، مما يتجاهل القدرة الكامنة داخل نماذج اللغة المرئية.

في محاولة لسد هذه الفجوة، قمنا بتحليل أنماط انتباه نماذج اللغة المرئية واكتشفنا عدة نتائج مثيرة:
1. تُظهر التعقيد البصري ارتباطًا قويًا بالتحصيل، مما يؤثر سلبًا على أداء التفكير.
2. يتطور الانتباه تدريجيًا من الفحص العام في الطبقات السطحية إلى التركيز العميق في الطبقات الأعمق، حيث يتحدد درجة التركيز بحسب التعقيد البصري.
3. من الناحية النظرية، أثبتنا أن تباين خرائط الانتباه بين الاستفسارات العامة والاستفسارات الخاصة بالمهام يُمكن من تحليل الإشارات البصرية إلى مكونات إشارات دلالية وضوضاء بصرية.

استنادًا إلى هذه الرؤى، قدمنا تقنية "تحسين الانتباه المتباين" (Contrastive Attention Refinement for Visual Enhancement - CARVE)، وهي طريقة لا تتطلب تدريبًا تستخرج الإشارات البصرية المرتبطة بالمهام من خلال تباين الانتباه على مستوى البكسل. وقد أظهرت التجارب الواسعة أن CARVE تعزز الأداء باستمرار، محققة تحسينًا يصل إلى 75% على النماذج مفتوحة المصدر.

تقدم هذه الدراسة رؤى هامة حول التفاعل بين التعقيد البصري وآليات الانتباه، مما يوفر مساراً فعالًا لتحسين التفكير البصري من خلال الانتباه المتباين. ما رأيكم في هذه التقنية الجديدة؟ هل تعتقدون أنها ستكون محورًا رئيسيًا في التطورات القادمة في هذا المجال؟ شاركونا في التعليقات!