تقدمت الدراسات أخيراً في مجال استرجاع الصور المعتمدة على النصوص (Text-based Image Retrieval - TBIR) بفضل التقدم الكبير في تقنيات تمثيل اللغة والصورة. ولكن، برزت مشكلة حقيقية يجب معالجتها، وهي أن معظم المعايير المطبقة تعود إلى افتراض تطابق صورة واحدة مع استعلام واحد، مما لا يعكس الواقع العملي في مجالات محددة مثل المراقبة.
لمواجهة هذه التحديات، تم تصميم محرك بيانات جديد يسمى *Domain-Specific Multi-Match Text-based Image Retrieval (DSMM-TBIR)*. يستند هذا المحرك إلى إنشاء معيار متعدد المطابقات لمجموعة من الصور الأمنية، حيث يضم 50,000 صورة مراقبة و200 استعلام شامل.
تظهر نتائج التجارب أن استخدام التعلم التبايني التقليدي في مجالات محددة يعاني من مشكلات حادة تتعلق بسلبيات كاذبة، مما يجبر النموذج على تمييز أزواج متشابهة معنوياً، وهذا يؤثر سلباً على الأداء. لذلك، اقترح الباحثون إطار عمل مبتكر يعرف باسم *Semantic-Aware Fine-Tuning (SAFT)* لحل مشكلات ضغط المعنى في مجالات محددة، حيث يتضمن تقنيات مثل *Semantic-Aware Soft-Label Supervision (SASS)* و*Intra-modal Structural Distillation (ISD)*.
من خلال التجارب التي أجريت على نماذج مشابهة لـ *CLIP*، أظهرت نتائج نموذج *SAFT* تحسنًا متوسطاً قدره 7.8 نقطة في معايير *mAP@20* على المعيار المحدد، إلى جانب تحسين الأداء في المجالات العامة أيضًا.
ستُتاح جميع هذه المعايير قريباً لتعزيز البحث في هذا المجال.
ابتكار جديد في استرجاع الصور المعتمدة على النصوص: تحديات وحلول متقدمة!
تمثّل دراسة جديدة قفزة نوعية في استرجاع الصور المعتمدة على النصوص، حيث تم تطوير محرك بيانات مخصص يعالج مشاكل الأداء في مجالات محددة كالمراقبة. تعرّفوا على نموذج (SAFT) لمواجهة التحديات الجديدة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
