في عالم التكنولوجيا المتقدم، باتت أنظمة القيادة الذاتية تعتمد بشكل كبير على نماذج الرؤية من السطح (BEV) التي تجمع بين المدخلات من الكاميرا والـ LiDAR لاكتشاف الأجسام في الفضاء ثلاثي الأبعاد. ورغم دقة هذه النماذج، فإن التحدي الأكبر يكمن في عدم قدرتها على التشغيل من خلال أطر الاستدلال القياسية. تكمن المشكلة في وجود عدم توافق بين عمليات الالتفاف الكثيفة (dense convolutions) التي تُدعم بشكل جيد، والتفافات ثلاثية الأبعاد النادرة (sparse 3D convolutions) التي لا يمكن للأطر تمثيلها، والعمليات الهندسية المتناثرة (geometric scatter operations) التي ليست لها مفردات خاصة بها في هذه الأطر.
اليوم، تُعد كل مكتبة للتفاف النادر مرتبطة بشكل حصري بـ CUDA وPyTorch، مما يقيّد نشر نماذج الرؤية من السطح إلى أجهزة من بائع واحد وإطار تنفيذ واحد. وهنا يأتي دور BEVPIPE، الإطار الثوري الذي تم تصميمه لنشرpipelines للرؤية من السطح متعددة الوسائط باستخدام واجهات برمجة التطبيقات (APIs) لحوسبة GPU المحمولة، ودمجها مع أطر الاستدلال الإنتاجية.
يقوم BEVPIPE بتقسيم النموذج إلى أجزاء كثيفة تتم إدارتها بواسطة أطر زمنية ويدعم ثلاثة مشغلين خارجيين (voxelizer وsparse encoder وBEV projector)، مرتبطة من خلال مساحة الذاكرة المشتركة لـ GPU. تُحقق هذه التقنية زيادة مذهلة في السرعة تصل إلى 19.5 ضعفًا مقارنة بالنشر التقليدي، تحتفظ في ذات الوقت بـ 98.5% من دقة المقياس المرجعي (mAP). ولا يتوقف الأمر هنا، بل يمكن لـ BEVPIPE أن يعمل بكفاءة عبر خلفيات GPU المختلفة. كيف يبدو لك هذا التطور الثوري في مجال القيادة الذاتية؟
حل معضلة عدم توافق المشغل: كيف يُعيد BEVPIPE تشكيل قدرة أنظمة القيادة الذاتية
هل تعلم أن أنظمة القيادة الذاتية تعتمد على نماذج الرؤية من السطح (BEV) لاكتشاف الأجسام في الفضاء ثلاثي الأبعاد؟ نقدم لكم حل BEVPIPE الذي يعزز كفاءة هذه الأنظمة مع زيادة السرعة والتحمل بفضل الابتكارات التقنية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
