في عالم الذكاء الاصطناعي، تلعب نماذج متعددة الوسائط (Multimodal Models) دوراً حيوياً، خاصةً في مجالات مثل التجارة الإلكترونية والبحث عن المنتجات. ولكن ماذا عن استرجاع البيانات على مستوى المناطق (Region-Level Retrieval)؟ هنا يأتي دور ريجريت (RegRet) الذي يعد نموذجاً مبتكراً يهدف إلى تحسين هذه العملية.
يعمل ريجريت على تلبية احتياجات المستخدمين عن طريق الارتباط بين مناطق الصور المحددة من قبلهم وبين المناطق ذات الصلة أو الأوصاف النصية، مما يزيد من دقة وفعالية الاسترجاع. بينما حققت نماذج متعددة الوسائط الكبيرة تقدماً ملحوظاً، إلا أنها كانت تركز بشكل أساسي على المهام العالمية، مما جعل من الصعب عليها التقاط تمثيلات فعالة على مستوى المنطقة.
يجسد ريجريت هذا الابتكار من خلال دمج شبه مخصص (Region-Aware Encoder) يمكنه التقاط تفاصيل دقيقة في المناطق بينما يوازن بينها وبين السياق العالمي. من خلال استخدام خط أنابيب تدريب متعدد المراحل، يتضمن مهام مثل كتابة تسميات محلية مفصلة والتعلم التمييزي للمنطقة، نحقق تحسيناً ملحوظاً في فهم التمثيلات.
ومع الاعتبار للبيانات النادرة المتعلقة بالتدريب التمييزي للمنطقة، قدمنا معيار REGMB الذي يتكون من 225 ألف زوج تمييزي، يغطي أربعة مهام للاسترجاع متعدد الوسائط. وقد أثبتت التجارب الواسعة فعالية نهجنا، حيث تفوق ريجريت على النماذج الأساسية في إعدادات عدم وجود بيانات، بينما أدى التدريب الإضافي باستخدام التعلم التمييزي إلى تحسين متوسط بنسبة تزيد عن 20٪ على كل من استاندرد REGMB والمعايير العامة، مما يضمن نتائج متفوقة أو متساوية في مهام الاسترجاع العالمية.
ريجريت: ثورة في استرجاع المناطق ضمن نماذج متعددة الوسائط
يقدم إطار العمل ريجريت (RegRet) ثورة في كيفية استرجاع البيانات على مستوى المناطق في نماذج متعددة الوسائط الكبيرة (Large Multimodal Models). يحقق هذا الابتكار توازناً مثالياً بين التفاصيل المحلية والسياق العالمي، مما يؤدي إلى تحسينات هائلة في الأداء.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
