في عالم الذكاء الاصطناعي، تُعتبر تقديرات كثافة الحشود من التحديات المعقدة التي تتطلب تقنيات دقيقة وفعّالة. يأتي نموذج CLIP-EBC ليُحدث ثورة في هذا المجال، حيث يعد أول نموذج مستقل يعتمد بشكل كامل على نموذج CLIP للتعرف بصورة دقيقة على أعداد الحشود.

على الرغم من النجاح الكبير الذي حققه نموذج CLIP في مهام التعرف، إلا أن إمكانياته في مجال العد لم يتم استكشافها بشكل كافٍ نظرًا للتحديات المرتبطة بتحويل مشكلة العد إلى مهمة متعلقة بالتعرف. لذلك، قام الباحثون بتطوير إطار العمل Enhanced Blockwise Classification (EBC) لتحسين قدرة CLIP على العد، مع التركيز على تقدير أحجام الحشود من الصور.

تتميز طرق تقدير كثافة الحشود التقليدية بعدم الدقة المحدودة، حيث غالبًا ما تُقيد قيم العد إلى صناديق عددية متاخمة، مما يؤدي إلى غموض في التسمية وقيم عد غير دقيقة.

ومع ذلك، تقدم EBC حلًا مبتكرًا من خلال استخدام صناديق قيم صحيحة، مما يقلل بشكل فعال من الغموض حول حدود الصناديق، ويعتمد أيضًا على خسارة الانحدار استنادًا إلى خرائط الكثافة لتحسين دقة توقعات العد.

من خلال تطوير نموذج CLIP-EBC، اتضح أن هذا الإطار يمكن أن يُحسن الأداء الخاص بالطرق التقليدية بنسب تصل إلى 44.5% على مجموعة بيانات UCF-QNRF. علاوةً على ذلك، حقق أيضاً CLIP-EBC أداءً مُتفوقًا على مجموعة اختبارات NWPU-Crowd، مسجلاً خطأ متوسطًا قدره 58.2 وRMSE قدره 268.5، مما يُظهر تحسنًا ملحوظًا بنسبة 8.6% و13.3% مقارنة بالنماذج السابقة مثل STEERER.

للمزيد من التفاصيل، يمكنكم زيارة المشروع على GitHub من خلال هذا الرابط: https://github.com/Yiming-M/CLIP-EBC.