تستمر النماذج البصرية اللغوية (Vision-Language Models) مثل CLIP في التألق بمستوى عالٍ من التعميم الدلالي، لكنها تبقى محدودة في قدرتها على إدراك التفاصيل الدقيقة للصور. في دراسة حديثة، تم تقديم نموذج KUEA كحل طبيعي لتحقيق تحسينات عبر إعادة ضبط مُشفّر الصور تحت إشراف النموذج البصري DINOv2. يهدف هذا الأسلوب إلى تعديل مصفوفات النواة بطريقة تلائم الصورة والنص بدقة.
ومع ذلك، أوضحت الدراسات أن التقليل من أهمية فقدان التوافق مع DINOv2 لا يؤدي بالضرورة إلى تدهور الأداء في الإدراك البصري الدقيق، مما يثير تساؤلات جديدة حول فعالية التوافق. لهذا السبب، أعدنا النظر في صياغة التوافق عبر تقديم منظور جديد لتوصيف الارتباط التمثيلي في فضاءات الميزات باستخدام تحليل الارتباط الشعاعي الكنسي (KCCA)، الذي يعمل على تعظيم علاقات الإسقاط.
في سياق التحسين، قمنا بتطوير نظام تدريب فعال من نقطة إلى نقطة بناءً على شروط KKT، متجنبين بذلك مشكلة القيم الذاتية في KCCA. بالإضافة إلى ذلك، قمنا بتوسيع طريقتنا إلى صيغة ثلاثية الرؤوس، تدعى 3vKCCA، حيث يتم دمج الإسقاطات من المُشفّر النصي المدرب مسبقًا ضمن إطار تحسين موحد للتوافق المشترك.
عند تطبيق 3vKCCA على نموذج CLIP ViT-L/14 باستخدام مجموعة بيانات ImageNet-1K، تحققنا من تحسين دقة MMVP-VLM من 17.8 إلى 25.9، مما يعكس أداءً متفوقًا مقارنةً بالأساليب الموجودة، في حين تحافظ الوظيفة على مستوى استرجاع الصور والنصوص صفر-لقطة.
ابتكار جديد في تعزيز تمثيل النماذج البصرية: استكشاف تحليل الارتباط الشعاعي الكنسي
كشف الباحثون عن طريقة مبتكرة تعزز من دقة الإدراك البصري في النماذج البصرية اللغوية (VLMs) باستخدام التحليل الكنسي للارتباط الشعاعي. نتائج مذهلة ترتقي بأداء النماذج الموجودة وتحافظ على قدرتها على استرجاع النصوص والصور.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
