في عالم الذكاء الاصطناعي، أصبحت الصور المُولّدة بواسطة النماذج التوليدية (Generative Models) مثل GANs والأطر المختلفة تُنتج صورًا وجهية يصعب تمييزها عن الصور الحقيقية. هذا التقدم المثير يثير القلق حول قضايا سرقة الهوية والنصب والاحتيال، مما يجعل الحاجة إلى أساليب فعّالة للكشف عن هذه التلاعبات أمرًا ملحًا.

تركز أبحاثنا على الوجوه المُولّدة بواسطة GAN، التي تشكل جوهر العديد من الأنماط المتعلقة بالتزييف العميق (Deepfake). نحن نقدم منهجيات مبتكرة للكشف عن هذه الصور باستخدام تحليل الصور فقط. أنظمة الكشف الحالية تعتمد بشكل كبير على الشبكات العصبية التلافيفية (CNNs) أو المحولات البصرية العالمية (Vision Transformers)، لكن كلا الطريقتين تكافح في مجالات معينة.

تقدم أبحاثنا نماذج مستندة إلى العمارة الجديدة، وهي Swin Transformer، مع ثلاث تطبيقات مختلفة. أولاً، نموذج Swin Transformer المضغوط المدرب من الصفر. ثم نماذج Swin-Tiny وSwin-Small المدربة مسبقًا على مجموعة بيانات ImageNet-1K. وأخيرًا، مجموعة هجينة جديدة تجمع بين معالجة EfficientNet-B0 التلافيفية وواجهة Swin Transformer.

قمنا بتقييم جميع النماذج باستخدام مجموعة بيانات تشمل 140,000 صورة حقيقية ومزيفة للوجوه، حيث تم استخدام صور مُولّدة بواسطة StyleGAN وصور حقيقية من Flickr وDFDC مع تقسيمات متوازنة للتدريب والتحقق والاختبار.

حقق نموذج EfficientNetB0+Swin دقة مذهلة تصل إلى 99% ودرجة استدعاء (Recall) تبلغ 99.44% على 5,000 صورة خلال الاختبار، متفوقًا على النسخ الصريحة من Swin وعلى قاعدة البيانات السابقة التي اعتمدت فقط على CNN. تشير نتائجنا إلى أن دمج ميزات CNN الهرمية مع الانتباه الذاتي المُعتمد على النوافذ المُزاحة يقدم طريقة فعّالة وخفيفة الوزن لكشف الوجوه المُولّدة بواسطة GAN.