في عالم تتبع الأجسام متعددة الأبعاد (Multi-Object Tracking أو MOT)، يكمن التحدي الأكبر دائمًا في الحفاظ على هوية الأجسام مع مرور الزمن، خصوصًا عندما تكون الأجسام صغيرة ومتقاربة في مشهد واحد، كما هو الحال في مشاهد أسراب النحل. معظم الأنظمة الحالية تعتمد على نماذج التعرف على الهوية (Re-ID) التي تم تدريبها من خلال تخصيص الحالات الفردية. لكن، مع الحاجة إلى تحديد الهوية بشكل عام بين مسارات متعددة واكتشافات، برزت الحاجة لحل أساسي جديد.
يأتي هنا نموذج VLA-ReID، الذي يُعيد صياغة التعرف على الهوية كعملية نموذجة ربط على مستوى الفيديو، حيث يعتمد على تجميع ميزات المسارات التاريخية كمجموعة من الأسئلة، فيما تعتبر جميع الاكتشافات في الإطار الحالي مرشحة للمقارنة، مما يتيح تحسين الربط العالمي في كل إطار.
علاوة على ذلك، يوفر النموذج تقدير مظهر مشترك (Frame-Common Appearance Estimation أو FCAE) من الاكتشافات الحالية، فيما تُعزز طريقة قمع المظهر المشترك (Common-Appearance Suppression أو CAS) من الاختلافات القابلة للتمييز بين الأجسام المتشابهة، دون الحاجة لتوثيق إضافي.
تظهر التجارب التي أُجريت على مجموعة بيانات BEE24 أن VLA-ReID يحسن من قياسات الأداء مثل HOTA، وMOTA، وAssR، فضلاً عن تقليل التحولات في الهوية بنحو 28% مقارنة بالأنظمة الرائدة. ما يجعل نتائج VLA-ReID تبرهن على فعالية النموذج في تعزيز الربط المبني على الظهور في مجال تتبع الأجسام المتعددة بالاعتماد على تقنيات الذكاء الاصطناعي.
ثورة في تقنيات تتبع الأجسام: VLA-ReID يغير القواعد!
يقدم نموذج VLA-ReID تقنية جديدة مبتكرة لتتبع الأجسام المتعددة في الفيديو، مما يحل مشاكل تحديد الهوية في مشاهد الأجسام المتشابهة. هذا الابتكار يعد خطوة متقدمة في عالم الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
