تُعتبر نماذج اللغة المرئية (Vision-Language Models - VLMs) من أبرز التطورات في مجالات الذكاء الاصطناعي والتعلم الآلي، حيث أثبتت قدرات مذهلة في التصنيف بدون مساعدة (Zero-Shot Capabilities) إلا أنها ما تزال تواجه تحديات في التعامل مع تغييرات توزيع البيانات في العالم الحقيقي أثناء عملية الاستدلال. رغم الجهود المبذولة لتكييف نماذج VLMs في وقت الاختبار، إلا أن النتائج تعتمد بشكل كبير على تسميات زائفة يتم التنبؤ بها مباشرة من تشابهات تمثيلية خام، مما يؤدي إلى عدم موثوقية تلك التسميات تحت تغيرات التوزيع ويسبب إرباكًا في عملية التكيف.
لتجنب تضخيم الضوضاء، طرحت الأعمال السابقة أهدافًا تعويضية بديلة لكنها غالبًا ما تفشل في تمثيل العلاقات بين العينات على مستويات مختلفة، مما يتسبب في عدم توافق الأهداف مع بيئة الاستدلال، ويؤدي إلى تحسين هام في الأداء.
في هذا البحث، تهدف الدراسة إلى سد الفجوة بين الأهداف المنفصلة للاستدلال والتكيف الخاص بنماذج VLMs، حيث تم اقتراح طريقة VLM TTA (Test-Time Adaptation) بأسلوب مبدئي. تتناول الدراسة تحدي التصنيف الصوري بدون مساعدة كمسألة مواءمة عبر الأنماط المختلفة، وتعتمد على صياغة Wasserstein OT (Optimal Transport) لتوفير تسميات زائفة موثوقة عند مستوى العينة، مما يساعد على تكييف نماذج VLMs بفاعلية.
وعند مرحلة التكيف، يتم استخدام خسارة InfoNCE (Information Noise Contrastive Estimation) لتكييف النماذج بناءً على التسميات الزائفة المدفوعة من Wasserstein، وهو ما يعكس العلاقات الدقيقة بين الصور والنصوص من خلال التعلم التبايني، مما يعزز دقة الاستدلال.
المثير للاهتمام هو أن الدراسة تكشف نظريًا أن خسارة InfoNCE يمكن أن تعاد صياغتها بمهارة كصيغة Wasserstein OT، مما يوحد أهداف الاستدلال والتكيف لنماذج VLMs لتحقيق فوائد متبادلة.
تثبت النتائج التجريبية الشاملة فعالية وكفاءة الطرق المقترحة، متفوقة على أفضل الطرق الحالية بنحو 7% مع كفاءة عالية تُعتبر الأفضل في هذا المجال.
من الاستدلال إلى التكيف: رؤية متكاملة حول نماذج اللغة المرئية
تتقدم الأبحاث المتعلقة بنماذج اللغة المرئية نحو تحسين أدائها، خاصة في مواجهة تغيرات توزيع البيانات في العالم الحقيقي. تستعرض هذه الدراسة طريقة جديدة تعزز قدرات النماذج في التصنيف بدون مساعدة سابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
