في ظل التقدم الثوري في مجال الذكاء الاصطناعي، ظهر حديثًا إطار جديد يُدعى Cog-VADU، الذي يقدم حلاً مبتكرًا للكشف عن الشذوذ في الفيديوهات دون الحاجة لتدريب مسبق. تعتمد تقنية الكشف عن الشذوذ في الفيديوهات (Video Anomaly Detection - VAD) على تحديد الأحداث غير الاعتيادية بشكل زمني في مقاطع الفيديو، إلا أن معظم التقنيات التقليدية تعتمد على التدريب مع مجموعات بيانات محددة، مما يُقلل من القدرة على التعميم في السيناريوهات المفتوحة.

مع ظهور أساليب جديدة تعتمد على نماذج اللغة البصرية الكبيرة (Large Vision-Language Models - LVLMs)، أصبح بالإمكان تخفيف هذه الاعتمادية، لكن غالبًا ما تفتقر هذه الأساليب إلى الاستمرارية الزمنية والتفكير المنظم. وهنا يأتي دور Cog-VADU، الذي يعيد صياغة الكشف عن الشذوذ في الفيديوهات كمسألة استدلالية معرفية متسلسلة.

Cog-VADU يقدم تقنية جديدة تُسمي شفرة تفكير سلسلة كشف الشذوذ (Chain-of-Anomaly Detection Thought Prompting - CoADTP)، والتي تُفكك نموذج LVLM إلى سلسلة من الاستدلالات المتكررة عبر مقاطع الفيديو. من خلال نشر المبررات الهيكلية على مر الزمن، يحتفظ النموذج بذاكرة زمنية ضمنية، مما يُمكنه من التمييز بشكل قوي بين الشذوذ المعقد والأنشطة العادية ذات الحركة العالية.

لتحسين الموثوقية، تم تصميم مرحلة إعادة تصنيف عبر النماذج تشمل توافق المبررات النصية مع التعابير البصرية، مما يُعزز التناسق الدلالي والتماسك الزمني لتوقعات أكثر دقة وثباتًا. أظهرت التجارب المكثفة على عدة مقاييس عامة للكشف عن الشذوذ في الفيديوهات أن Cog-VADU يحقق أداءً تنافسيًا في نمط عدم التدريب. علاوة على ذلك، تُظهر التقييمات عبر النماذج أن CoADTP يعزز بشكل دائم الكشف عن الشذوذ المستند إلى الاستدلال بطريقة غير معتمدة على نموذج معين، مما يوفر فهمًا قابلًا للتفسير والعمومية للشذوذ في التطبيقات الواقعية.

بفضل هذه الابتكارات، يبدو أن Cog-VADU سيكون له تأثير كبير على كيفية معالجة تحليل الفيديو في المستقبل، مما يمنحنا أدوات أقوى لفهم الأحداث غير المتوقعة والتعامل معها.