تشهد نماذج الرؤية-اللغة (Vision-Language Models) تقدمًا كبيرًا في مجال الفهم المتعدد الوسائط. واجهت هذه النماذج تحديات تتعلق بتوسيع نماذج مجموعة الخبراء المختلطة (Mixture-of-Experts) نظرًا للاحتياجات العالية للذاكرة وتأثير الوقت الناتج عن طريقة التحميل عند الطلب. وللتصدي لهذه المشكلة، ظهرت مؤخرًا معمارية التضمين لكل طبقة (Per-Layer Embedding) التي تستخدم جداول تضمين كبيرة مخزنة في الذاكرة للقراءة فقط (ROM) وتعمل على استرجاع التضمينات المهمة لتعزيز تمثيلات الرموز. ومع ذلك، كانت الأساليب الحالية في هذا الإطار مخصصة بشكل رئيسي لتضمينات النصوص، مما يحد من فعاليتها في نماذج الرؤية-اللغة التي تحتوي على معلومات أكثر ثراءً.
ولهذا، تم تقديم LookME، الإطار الأول من نوعه الذي يتيح تعزيز التضمينات المتعددة الوسائط باستخدام أسلوب الاسترجاع، الداعم للتخزين المقسم والتحميل عند الطلب. يعتمد LookME على طريقة استرجاع هرمية ذات مستويين، تبدأ من مستوى المشهد وصولًا إلى المستوى الدقيق داخل المشهد.
تتميز LookME أيضًا باستراتيجية حقن رفيعة الحجم، التي تعطي الأولوية للتضمينات الحرجة وتساعد في إعادة استخدام جداول التضمين عبر الطبقات المتجاورة، مما يُحسّن التوازن بين الكفاءة وحجم النموذج وأدائه. تظهر التجارب على عدة اختبارات بصرية أن LookME يتفوق على الأساليب المعتمدة على النصوص فقط، مما يثبت فعالية تعزيز التضمينات متعددة الوسائط.
انطلاقة مذهلة في نماذج الرؤية-اللغة: تعرف على LookME!
تسعى LookME لتطوير نماذج الرؤية-اللغة عبر تعزيز فاعلية التضمينات المتعددة الوسائط. هذا النموذج الجديد يُعيد تعريف كيفية معالجة المعلومات البصرية والنصية بطرق مبتكرة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
