تُعتبر نماذج CLIP (Contrastive Language-Image Pretraining) من النماذج الرائدة في دمج الرؤية واللغة، حيث يتخذ CLIP الشكل القياسي كموصّل للرؤية في تطبيقات نموذج الرؤية واللغة (Vision-Language Models) الأخرى مثل LLaVA. قدّم البحث الجديد خطوات مُهمة في تحسين أداء CLIP بعد التدريب، لكنّ بعض الدراسات انتقدت استخدام خسارة التباين المعتادة في هذه المرحلة بسبب المخاطر المرتبطة بفقدان المعلومات عند التعامل مع مجموعات صغيرة من البيانات.

تُظهر نتائج البحث أن فقدان المعلومات ليس ناجمًا عن نقص في العناصر السلبية، بل يرجع أساسًا إلى الحجم غير المناسب لدرجة التباين، الممثلة بالرمز $ au$. عندما تم ضبط $ au$ على قيمة صغيرة بشكل كافٍ، أظهر التدريب اللاحق القائم على التباين نتائج أفضل مما كان متوقعًا، وهو ما يفسر عبر اعتماد_gradient على درجة التباين.

استنادًا إلى هذه النتائج، قدّم الباحثون مقاربة جديدة تعرف باسم ComCLIP، وهي طريقة خفيفة الوزن لتدريب CLIP بعد المرحلة الأولية. هذه المقاربة تجمد تشفير النص في CLIP، مما يجعل مُشفر الرؤية المُعدل بديلاً شفافًا مع الحفاظ على نفس التصميم والتكاليف أثناء الاستدلال.

اعتمدت الطريقة الجديدة على خسارة تباين مُعدلة بشكل صحيح، جنبًا إلى جنب مع خسارة مرجعية تعتمد على خوارزمية الـ MSE مقابل النسخة الأصلية من CLIP. على مدار تجارب متعددة، نجح ComCLIP في تقليص الفجوة بينه وبين أداء CLIP-Refine في التصنيف بدون إشراف، مع تحسين ملحوظ في قدرة نقل الميزات البصرية.

استُخدم ComCLIP كموصل للرؤية في LLaVA-1.5-7B دون الحاجة لإعادة ضبط مُعادل الإدخال أو النموذج الكبير (LLM)، دون التأثير على السلامة التامة للأداء عبر ثمانية مراجع لنماذج الرؤية واللغة المختلفة. الكود والنماذج متاحة على GitHub.