في الآونة الأخيرة، نالت تقنية اكتشاف الأجسام ثلاثية الأبعاد (3D Object Detection) مفتوحة المفردات (Open-Vocabulary) اهتمامًا متزايدًا، نظراً لقدرتها على الكشف عن الأجسام غير المرئية في المشاهد ثلاثية الأبعاد. تعتمد الطرق المتبعة حالياً عادةً على نموذج ذي مرحلتين، حيث يتم أولاً اكتشاف الأجسام الجديدة باستخدام نماذج مؤسسية، ومن ثم تدريب نموذج 3D-OVD استناداً إلى هذه الأجسام المكتشفة.
وعلى الرغم من فعالية هذا النهج، إلا أن عمليته تعاني من مشاكل تتعلق بتحديد المواقع غير الدقيقة والتصنيفات المتطابقة بشكل خاطئ خلال مرحلة الاكتشاف، مما يحد من أداء مرحلة تدريب النموذج.
للتغلب على هذه التحديات، نقدم إطارًا مبتكرًا يركز على تحسين كل من موثوقية اكتشاف الأجسام الجديدة وموثوقية التدريب على النموذج.
تستند استراتيجيتنا للتقطير المزدوج على تجميع الأجسام الحديثة عالية الجودة من خلال تطبيق تطابق هنجاري (Hungarian matching) باستخدام معايير شاملة تأخذ في الاعتبار الاتساق الهندسي، وموضوعية الهيكل، واليقين الدلالي.
لزيادة قوة تدريب النموذج، اقترحنا أيضًا مخطط تعلم ثلاثي التوجيه، مما يعزز من توجيه عدم اليقين المرتبط بالوعي بالمشهد لرأس التراجع، والتوجيه الهرمي المستند إلى نموذج اللغات الكبيرة (LLM) لرأس التصنيف، مما يخفف من الآثار السلبية للصناديق ثلاثية الأبعاد غير الدقيقة والغموض الدلالي.
تشير التجارب الواسعة التي أجريت على مجموعات بيانات SUN RGB-D وScanNetV2 إلى أن أسلوبنا يحقق تحسينات ملحوظة في الأداء مقارنةً بأحدث الأساليب. يمكنكم الاطلاع على الكود على GitHub.
اكتشاف الأجسام ثلاثية الأبعاد باستخدام نموذج مفتوح المفردات: كيف يغير الذكاء الاصطناعي القواعد!
تمثل تقنية اكتشاف الأجسام ثلاثية الأبعاد (3D-OVD) ثورة جديدة في القدرة على الكشف عن الأجسام غير المرئية. استخدام استراتيجية التقطير المزدوج يعزز تعزيز فعالية نماذج الذكاء الاصطناعي وزيادة دقتها بشكل ملحوظ.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
