تعتبر مهمة إكمال الرسوم البيانية المعرفية متعددة الوسائط (Multimodal Knowledge Graph Completion - MKGC) هي عملية استدلال للكيانات المفقودة بناءً على معلومات هيكلية، نصية، وبصرية. ومع ذلك، تظهر الطرق الحالية القائمة على الانتشار صعوبة في أداء هذه المهمة بسبب التداخل بين الخصائص متعددة الوسائط والاضطراب القائم على العلاقات.
لذلك، تم تقديم إطار العمل الجديد MGDT (MLLM-Guided Diffusion Transformer)، الذي يعتمد على نموذج الانتشار الموجه بواسطة لغة متعددة الوسائط (Multimodal Large Language Model - MLLM). يعتمد هذا الإطار الثوري على مفهوم "التهيئة ثم الانتشار"، حيث يعالج أولاً المعلومات عبر وحدة RASR-MoE (Relation-Adaptive Semantic Routing Mixture-of-Experts) التي تختار المسارات المناسبة وتعزل التأثيرات غير المرغوب فيها.
بعد ذلك، يستخدم MGDT نموذج MLLM كمرجع دلالي لتمكين التوافق بين تمثيلات متعددة الوسائط في فضاء موحد، مما يقلل من التباين الدلالي بين الأشكال. أخيرًا، يقوم نموذج KGDT (Knowledge Graph Diffusion Transformer) بإجراء عمليات تحسين معتمدة على الرسوم البيانية لإنتاج تمثيل الكيانات المفقودة.
تشير التجارب التي أجريت على ثلاثة مجموعة بيانات قياسية إلى أن MGDT يتفوق باستمرار على النماذج الأساسية القوية، مما يعد خطوة قوية نحو تطوير تقنيات الذكاء الاصطناعي في مجال البيانات المعقدة.
ما رأيكم في هذا الإنجاز المدهش؟ هل تعتقدون أنه سيغير قواعد اللعبة في مجال الذكاء الاصطناعي؟ شاركونا آرائكم في التعليقات!
MGDT: الإبتكار الثوري في إكمال الرسوم البيانية المعرفية متعددة الوسائط
تم تقديم MGDT، الإطار الجديد لإكمال الرسوم البيانية المعرفية متعددة الوسائط، والذي يستخدم نموذج MLLM لتحسين الأداء. هذا الابتكار يسد الفجوات الكبيرة في استدلال الكيانات المفقودة عبر نظم متعددة الوسائط.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
