في عالم الذكاء الاصطناعي، يعتبر تعلم تمثيلات الكيانات المتعددة الوسائط (Multimodal Entity Representations) خطوة أساسية لأداء المهام المعقدة مثل إكمال الرسومات المعرفية المتعددة الوسائط (Multimodal Knowledge Graph Completion - MMKGC). إلا أن الأساليب الحالية تعاني في كثير من الأحيان من تحديات تتعلق بمشكلات التنعيم السيميائي (Semantic Over-Smoothing) داخل الوسائط، وكذلك من عدم فعالية ترشيح الضوضاء (Noise Filtration) عبر الوسائط، خاصة في الظروف النادرة أو الغامضة.
للتغلب على هذه العقبات، تم اقتراح إطار العمل PrismF، الذي يجمع بين تعزيز وجهات النظر المتعددة (Multi-Perspective Enhancement) والدمج التدريجي (Progressive Fusion) لاستخراج إشارات أقوى من مدخلات متنوعة. يقوم PrismF بتعزيز المعاني الدقيقة داخل الوسائط من خلال آلية متعددة الوجهات تكسر كل وسيلة إلى رؤى تكاملية وتفرض حدودًا باستخدام خسارة فصل (Decoupling Loss) لتحسين التمثل.
علاوة على ذلك، يعمل على تحسين التكامل بين الوسائط من خلال استراتيجية دمج تدريجي تضبط ديناميكيًا التفاعلات بين الوسائط، مما يمكّن النموذج من التركيز على الإشارات المفيدة بينما يخمد الإشارات الضوضائية أو غير الموثوقة.
تظهر التجارب الشاملة على ثلاثة معايير عامة أن PrismF يحقق أداءً فائقًا، مع تحسينات نسبية تصل إلى 4.04% في MRR و11.17% في Hits@1 على مجموعة بيانات KVC16K. لمزيد من التفاصيل حول هذا الإطار الجديد وأكواد التجربة، يمكنك زيارة الرابط إلى الكود.
إشارات أقوى وآفاق جديدة: كيف تعزز تقنيات التعلم المتعدد الوسائط تجربة تمثيل الكيانات!
تقدم تقنية PrismF إطار العمل المتكامل لتعزيز التجربة الحسية للكيانات المتعددة الوسائط، مما يحسن من دقة نتائجها بشكل ملحوظ. تعرف على كيفية تجاوز التحديات التقليدية في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
