مع التطورات السريعة في الذكاء الاصطناعي، بات من الضروري التحقق من صحة صور الأقمار الصناعية، خاصةً في ظل ظهور الصور المزيفة (deepfakes) التي يتم استخدامها لأغراض ضارة. هذه الصور الاصطناعية عالية الدقة يمكن أن تؤدي إلى عواقب وخيمة في مجال الاستشعار عن بُعد، حيث تعدّ البيانات الساتلية مصدرًا أساسيًا للمعلومات في تطبيقات متعددة مثل التخطيط واللوجستيات والمراقبة.

إحدى التحديات الكبرى التي تواجه مجتمع الاستشعار عن بُعد هي عدم توفر مجموعات بيانات ذات جودة عالية وتفاصيل دقيقة لتدريب وتقييم خوارزميات الكشف والتحقيق في الصور. المجموعات الحالية إما تفتقر إلى أقنعة الحقيقة الأرضية اللازمة لتقييم موضع التلاعب أو تتكون من صور كاملة تم إنشاؤها بواسطة نماذج مثل Generative Adversarial Networks (GANs) أو نماذج الانتشار (Diffusion Models)، والتي لا تتناسب مع قياس أداء تحديد المواقع.

لتلبية هذه الحاجة المتزايدة، تم تقديم عملية أولية لإنشاء مجموعة بيانات جديدة تعتبر مرجعًا في مجال كشف تلاعب صور الأقمار الصناعية. تحتوي هذه المجموعة على 60 صورة، حيث تم تعديل 30 صورة بعناية باستخدام ثلاثة أنواع من التلاعب، بما في ذلك الدمج (copy-paste splicing) وإعادة بناء الصورة باستخدام نماذج الانتشار. بالإضافة إلى ذلك، يتم تضمين 30 صورة أصلية.

كل صورة تأتي مع قناع حقيقي (ground-truth mask) وبيانات الاستحواذ، مما يسهل قياس أداء تحديد المواقع على مستوى البكسل، ودراسات بيانات الصور، وتحليل كيفية تأثير أداء كشف التلاعب على معلمات جمع الصور.

تستهدف هذه البيانات دعم الأبحاث المستقبلية في مجالات التحقيق في الصور وكشف التلاعب الجغرافي، ويمكن تنزيل مجموعة البيانات التجريبية من الموقع التالي: https://huggingface.co/datasets/geodf/fmow-fake-small.