في عصر تتزايد فيه واقعية الصور المعدلة والمولدة، تصبح موثوقية الوسائط الرقمية على المحك. وقد أظهرت أجهزة الكشف عن الديب فيك (Deepfake) المدعومة بنماذج الرؤية الأساسية قدرة واعدة في التعرف على هذه التلاعبات. ومع ذلك، فإن معظم هذه الأنظمة تعتمد على تمثيلات مسبقة التدريب واحدة، مما يجعلها عرضة للمبالغة في التكيف مع توزيعات التدريب المعينة.
في خطوة مبتكرة، تم تقديم UCF-Net، وهي شبكة اندماج تسلسلية مدركة لعدم اليقين، تستفيد من المبادئ الدلالية المستندة إلى اللغة من CLIP (Contrastive Language-Image Pre-training) والأبعاد الهيكلية البصرية ذاتية الإشراف من DINO (Self-Distillation with No Labels). من خلال استخراج ميزات هرمية عبر أعماق Transformers، تقوم UCF-Net بتجميع الخبراء على مستوى الطبقات لدمج الإشارات متعددة المستويات بشكل تكيفي، كما تقوم بإجراء اندماج موزون للتمثيلات الناتجة استنادًا إلى عدم اليقين المستمد من الانتروبيا.
لزيادة موثوقية النتائج، تم دمج مجموعات بيانات الديب فيك العامة في معيار موحد يتضمن حوالي 4 ملايين صورة، بجانب إنشاء مجموعة تقييم مستقلة تضم أكثر من 8 آلاف صورة وجه من ثمانية مولدات حديثة. عند اختبارها على المعيار الموحد، حققت UCF-Net أفضل متوسط لقيمة المنطقة تحت المنحنى (AUC) بين الطرق التي تم تقييمها في كل من مراجعات النطاق الداخلي والنطاق الخارجي. كما أنها أثبتت فاعليتها في التأقلم مع بيانات نطاق الهدف المحدودة، على الرغم من أن النقل بدون تدريب يظل تحديًا مستمرًا.
باستخدام هذه التقنيات المتطورة، تُعتبر UCF-Net بالفعل تحولًا في مكافحة التلاعبات الرقمية وتعزيز مصداقية الوسائط، مما يفتح الأفق أمام جيل جديد من أجهزة الكشف عن الديب فيك التي تتمتع بقدرة أكبر على التعميم والمواجهة مع تحديات المستقبل.
تقنية ثورية لاكتشاف صور الديب فيك: UCF-Net تستغل قوة CLIP وDINO لرصد التلاعبات بدقة
تتحدى تقنية UCF-Net الجديدة التلاعبات الرقمية المتزايدة، حيث تستخدم استراتيجيات متقدمة من CLIP وDINO لتعزيز دقة الكشف عن صور الديب فيك. مع القدرة على التعميم عبر بيانات غير مرئية، تعتبر هذه التقنية خطوة هائلة نحو حماية مصداقية الوسائط الرقمية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
