في عصر تكنولوجيا الفيديو المتقدمة، يتطلب العد الفعّال للكائنات في المشاهد المزدحمة حلولاً مبتكرة تتجاوز الطرق التقليدية. هدفنا الرئيسي هو تحسين تحديد عدد الكائنات في تلك المشاهد، بناءً على نصوص أو إشارات مرئية محددة. يعتمد معظم الطرق الحالية على معلومات RGB فقط، مما يحدد قدراتها التمييزية في الأوضاع المزدحمة والمخفية.
لذلك، نقدم لكم الكاشف المدفوع بالعمق (Depth-Guided Detector - DG-Det)، والذي يعمل بالتوازي مع خط أنابيب معالجة متكامل. من خلال دمج إشارات العمق مع تقنية الانتباه المتداخل من RGB-D (Multi-scale RGB-D Cross-Attention) وتنبؤات العوائق الصريحة، يعزز أسلوبنا الفهم المكاني ويحقق دقة قوية في المشاهد المعقدة.
علاوة على ذلك، قدمنا إطاراً موحداً لإزالة التكرار عبر الإطارات، مما يقضي على العد المكرر للكائنات.
لتسهيل الأبحاث المستقبلية، أطلقنا مجموعة بيانات جديدة لعد الكائنات في الفيديو توفر معلومات العمق وخصائص متعددة لكل تسلسل. تُظهر التجارب الواسعة أن أسلوبنا يحقق تقليصاً بنسبة 62.01% في الخطأ المطلق (Mean Absolute Error - MAE) مقارنة بالأساليب السابقة، بالإضافة إلى تحسينات مستمرة في الخطأ الجذري المتوسط (Root Mean Square Error - RMSE).
يمكن الوصول إلى كود المصدر الخاص بنا عبر [https://github.com/streamer-AP/DG-Net] وإلى مجموعة البيانات عبر [https://huggingface.co/datasets/aerospace123/RGBD-VideoCount]. هل أنتم متحمسون لاستخدام هذه التقنية الحديثة في مشاريعكم المقبلة؟ شاركونا في التعليقات.
ابتكار ثوري في عدد الكائنات بالفيديو: العد الفعّال في الزحام
تم تطوير نظام جديد لتتبع عدد الكائنات في مشاهد مزدحمة باستخدام إشارات العمق، مما يعزز القدرة على التمييز في الظروف المعقدة. النظام يحقق نتائج متفوقة في تقليل خطأ العد.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
