في عالم التكنولوجيا المتقدم، باتت أنظمة القيادة الذاتية تعتمد بشكل كبير على نماذج الرؤية من السطح (BEV) التي تجمع بين المدخلات من الكاميرا والـ LiDAR لاكتشاف الأجسام في الفضاء ثلاثي الأبعاد. ورغم دقة هذه النماذج، فإن التحدي الأكبر يكمن في عدم قدرتها على التشغيل من خلال أطر الاستدلال القياسية. تكمن المشكلة في وجود عدم توافق بين عمليات الالتفاف الكثيفة (dense convolutions) التي تُدعم بشكل جيد، والتفافات ثلاثية الأبعاد النادرة (sparse 3D convolutions) التي لا يمكن للأطر تمثيلها، والعمليات الهندسية المتناثرة (geometric scatter operations) التي ليست لها مفردات خاصة بها في هذه الأطر.

اليوم، تُعد كل مكتبة للتفاف النادر مرتبطة بشكل حصري بـ CUDA وPyTorch، مما يقيّد نشر نماذج الرؤية من السطح إلى أجهزة من بائع واحد وإطار تنفيذ واحد. وهنا يأتي دور BEVPIPE، الإطار الثوري الذي تم تصميمه لنشرpipelines للرؤية من السطح متعددة الوسائط باستخدام واجهات برمجة التطبيقات (APIs) لحوسبة GPU المحمولة، ودمجها مع أطر الاستدلال الإنتاجية.

يقوم BEVPIPE بتقسيم النموذج إلى أجزاء كثيفة تتم إدارتها بواسطة أطر زمنية ويدعم ثلاثة مشغلين خارجيين (voxelizer وsparse encoder وBEV projector)، مرتبطة من خلال مساحة الذاكرة المشتركة لـ GPU. تُحقق هذه التقنية زيادة مذهلة في السرعة تصل إلى 19.5 ضعفًا مقارنة بالنشر التقليدي، تحتفظ في ذات الوقت بـ 98.5% من دقة المقياس المرجعي (mAP). ولا يتوقف الأمر هنا، بل يمكن لـ BEVPIPE أن يعمل بكفاءة عبر خلفيات GPU المختلفة. كيف يبدو لك هذا التطور الثوري في مجال القيادة الذاتية؟