في عالم القيادة الذاتية، أصبح دمج تقنيات الكاميرا وليدار (LiDAR) طريقة شائعة للتعرف على الأجسام ثلاثية الأبعاد (3D Object Detection). لكن، تشير الدراسات إلى أن الأنظمة الحالية غالبًا ما تعتمد بشكل كبير على التداخلات بين الأنماط الحسية، مما يؤدي إلى ضعف الأداء في حال مواجهة ظروف قيادة سيئة أو غير موثوقة. هنا يظهر دور الابتكار الجديد، SARFusion - تقنية متميزة تهدف إلى معالجة تلك التحديات.

تتمثل فكرة SARFusion في إعادة صياغة دمج الكاميرا وليدار كمسألة توجيه قائمة على المشهد. بدلاً من الحصول على كشف عن الأجسام من تمثيل موحد، تقوم SARFusion بفصل عملية فك تشفير استفسارات الأجسام إلى ثلاثة فروع موازية: فرع الكاميرا، فرع الليدار، وفرع الدمج. هذا النهج يسمح بالتعامل مع كل استفسار بشكل أكثر دقة، مستفيدًا من موثوقية المشهد العالمية.

تعتمد SARFusion على تقديرات الثقة بالش Scene Reliability Prior بما يتماشى مع السيناريو القيادي الكلي وتدمج الأدلة على مستوى الكائن لتوجيه كل استفسار إلى الفرع الأنسب. هذه الاستراتيجية تساعد في التقليل من التأثيرات السلبية الناتجة عن المعلومات الضعيفة بينما تكسب فوائد الدمج متعدد الأنماط عند توفر إشارات موثوقة.

عند اختبارها على مجموعة بيانات nuScenes، حققت SARFusion أداءً قويًا مع 72.5 mAP و74.4 NDS، مما يُظهر قوتها تحت ظروف صعبة تشمل تلف المستشعرات وتغيرات بيئية. تشير التحليلات الموسعة إلى أن نظام SARFusion لن يكون مجرد تقنية جديدة، بل قد يكون خطوة كبيرة نحو القيادة الذاتية الأكثر أمانًا وكفاءة.