في عالم تكنولوجيا المراقبة المرورية، يواجه الباحثون تحدياً كبيراً يتمثل في الفجوة الجغرافية (geographic domain shift) والتي تؤثر سلباً على أداء النماذج المتعلمة في مدينة معينة عند تطبيقها في مدينة أخرى غير معروفة. تعرض العديد من تقنيات التكيف التقليدي لمشاكل تتعلق بالحساسية المفرطة للمعلمات أو الحاجة إلى تحليل بيانات مستهدفة مباشرة، وهي أمور يصعب تحقيقها في أنظمة تراعي الخصوصية.

لذا، قام فريق من الباحثين بمراجعة فعالية استراتيجيات ما قبل التدريب (pre-training) والتعزيز (augmentation) في معالجة هذه المشكلة. وقد اقترحوا نموذج تدريب جديد لوظائف كشف الأجسام يعتمد على ركيزتين رئيسيتين: الأولى، استراتيجية ما قبل التدريب المتعددة المجاميع (multi-dataset pre-training) والتي تميز بين هيكل السيارة والتصنيفات الدلالية، والثانية، سلسلة تعزيز قوية (domain-resilient augmentation) التي تقدم تحويل Grayworld الجديد الذي يجبر النماذج على تجاهل المعلومات اللونية المتقلبة والتركيز على الأشكال الفعالة.

عند تقييم هذا النموذج مع كاشف قائم على التحويلات الزمنية، المعروف باسم RF-DETR، نجح الإطار في سد الفجوات التوزيعية بين المدن، مع استخدام ذاكرة GPU محدودة تبلغ 16 جيجابايت. وأظهرت المتغيرات المحسنة من النموذج، RF-DETR-HR وRF-DETR-Grayworld، زيادة ملحوظة بنسبة +24.29%. وصلوا إلى المركز الأول في تصنيف AI City Challenge Track 6، محققين معدل دقة متوسط (mAP) وصل إلى 47.53.

لمزيد من التفاصيل، يمكن الاطلاع على الكود والبيانات المتاحة عبر الرابط إلى المشروع. فما رأيكم في هذه الابتكارات؟ هل تعتقدون أنها ستغير قواعد اللعبة في أنظمة المراقبة الذكية؟ شاركونا في التعليقات!