في مجال الذكاء الاصطناعي، لا يخفى على أحد أن نماذج الرؤية واللغة (Vision-Language Models) مثل CLIP قد حققت نجاحًا كبيرًا في مهام التصنيف بدون تدريب مسبق (Zero-Shot Classification). ومع ذلك، تظهر المشكلة عندما يتعرض النموذج لتغيرات في التوزيع، حيث يمكن أن تنحرف التضمينات البصرية (Visual Embeddings) عن التضمينات النصية الثابتة. هنا يأتي دور الأسلوب الجديد المتمثل في إعادة تمركز المجال مع تصحيح الأولويات الموزونة (Domain Recentering with Confidence Calibration - DRC).
هذا الابتكار هو طريقة جديدة لا تحتاج إلى تدريب، تهدف إلى تكييف نموذج CLIP باستخدام مجموعة من الصور المستهدفة غير المعلَّمة (Unlabeled Target Images). تتضمن العملية استخدام مزيج غاوسي (Gaussian Mixture) واحد، حيث يتم حساب متوسط الأوزان اللاحقة لكل تضمين ثم يتم إزالة أي تفضيل فئوي متبقٍ باستخدام تصحيح اللوج البسيط (Log-Prior Correction).
تجارب المقارنة أظهرت أن DRC قد حقق أعلى دقة متوسطة على مجموعات بيانات متعددة النطاقات، حيث تجاوز أداء نموذج CLIP بمعدل 4.13 و5.07 نقاط باستخدام بنية ViT-B/16 وResNet-50 على التوالي، كما أن الفوائد المتعلقة بأداء النموذج استمرت حتى تحت ظروف تغير توزيع بيانات ImageNet.
هذه التطورات تمثل خطوات هائلة نحو تحسين فهم نماذج الرؤية واللغة، مما يمكنها من التعامل بفاعلية أكبر في أوقات التغير السريع في ظروف البيانات. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
إعادة تمركز المجال وتصحيح الأولويات الموزونة لتعزيز أداء نماذج الرؤية واللغة!
تتضمن الأبحاث الجديدة تحسينات ملحوظة لفعالية نماذج الرؤية واللغة مثل CLIP، من خلال تقنيات مبتكرة لتعزيز الأداء تحت ظروف تغير التوزيع. يعزز الأسلوب الجديد DRC دقة التصنيف بشكل كبير دون الحاجة إلى تدريب إضافي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
