في خطوة مثيرة في مجال الذكاء الاصطناعي، قدم مجموعة من الباحثين إطار عمل خفيف الوزن من مرحلتين لاكتشاف الانحرافات في الفيديوهات بشكل فوري. المرحلة الأولى تستخدم تقنية YOLO v11n-pose لاكتشاف الأشخاص واستخراج سبعة عشر نقطة هيكلية في عملية واحدة. بينما المرحلة الثانية تستخدم نموذج CLIP (Contrastive Language-Image Pre-training) مع بنية ViT-B/32 لتحليل المناطق المحصورة لكل شخص وحساب التشابه الكوني مقابل أوصاف نصية مسبقة للسلوكيات الشاذة.

تتميز هذه المعمارية بإلغاء الحاجة للتدفقات الضوئية، واستخدام مُقدّري الوضعية المستقلة، ووحدات التقييم المبنية على الكثافة. أثبتت التجارب التي أجريت على مجموعة بيانات CUHK Avenue، وShanghaiTech Campus، وبيانات داخلية مخصصة تم جمعها في جامعة تشولالونغكورن، قدرة الإطار على تحقيق معدل إطارات يصل إلى حوالي 51 إطار في الثانية على وحدة معالجة الرسوميات NVIDIA Titan XP، وهو ما يمثل زيادة قدرها 3.36 مرة مقارنةً بالأساليب التقليدية.

الأرقام تتحدث عن نفسها، حيث حقق النظام أداءً متميزًا مع قيم AUROC عند مستوى الإطار بلغت 89.26%، 70.26%، و84.13% على التوالي. يظهر هذا التطور الرائع كيف يمكن للتقنيات الحديثة أن تساعد في توجيه جهود الأمن والمراقبة، مما يجعل اكتشاف الانحرافات أكثر فعالية وسرعة من أي وقت مضى. ما هي توقعاتكم حول مستقبل اكتشاف الانحرافات في الفيديو باستخدام الذكاء الاصطناعي؟ شاركونا آراءكم في التعليقات!