هل سئمت من عدم القدرة على اكتشاف الشواذ في بيانات المراقبة؟ قد يكون الحل في النموذج الجديد القائم على تقنيات الذكاء الاصطناعي. تم تقديم نموذج MIL-VLM الفيدرالي الذي يُعيد تشكيل الطريقة التي نتعامل بها مع بيانات المراقبة الموزعة.

تواجه تقنيات اكتشاف الشواذ في الفيديو (Video Anomaly Detection) تحديات كبيرة، خاصة عندما تكون البيانات المراقبة موزعة وضعيفة التعليم. عادةً ما تفترض الأساليب التقليدية تدريباً مركزياً، لكن النموذج الجديد الذي تم تطويره يغير هذا الوضع.

يتكون نموذج MIL-VLM الفيدرالي من سلسلة خفيفة الوزن، حيث يتم تدريب مُقيّم مُركّز على جميع العملاء، في حين يقوم نموذج اللغة والرؤية (Vision-Language Model) المتجمد بالتحقق من المقاطع المشبوهة لاحقاً. يتيح هذا الأسلوب استخدام واجهتين مختلفتين للتفاعل مع MLI-VLM: واجهة تعتمد على اتخاذ قرارات نصية وتحليلات لوجيت، مما يمكنه من استخراج درجات مستمرة للشواذ اعتماداً على احتمالات "نعم/لا".

تجارب أجريت على مجموعة بيانات UCF-Crime باستخدام نماذج InternVL3.5-2B وQwen3-VL-2B-Instruct أظهرت أن التحقق عن طريق توليد النصوص يمكن أن يحسن AUC على مستوى الإطار بعد معالجة زمنية تشخيصية. ومع ذلك، فإن النتائج كانت حساسة جداً لبنية النظام واختيار النماذج وخيارات التوليد.

على الجانب الآخر، فإن واجهة اللوجيت تقدم إشارة ثابته خالية من المحلل، مما يحسن AUC وAP على مستوى الإطار دون الحاجة لمعالجة زمنية إضافية. تعتبر هذه التقنية الجديدة بديلاً سهلاً ومباشراً للتحقق من توليد النصوص.

بفضل النموذج الجديد، يمكن تحديث المقاطع المشبوهة بشكل مستقل مما يوفر طريقة بسيطة وعالية الفعالية للتحقق.

هل تعتقد أن هذا النموذج سيحدث ثورة في مجال مراقبة الفيديو؟ شاركونا آراءكم في التعليقات!