تتطور نماذج المشاهد الجغرافية (Geospatial Foundation Models) لتصبح من الوسائل الأحدث في تنفيذ مهام الرصد الأرضي. في السنوات الأخيرة، ظهرت العديد من منهجيات التدريب المسبق، لكنها غالبًا ما تعالج الصور من منظور مفهوم واحد، مما يؤدي إلى فشلها في التقاط الطبيعة التركيبية المعقدة لمشاهد الأقمار الصناعية.

لذا، نقدم في هذا المقال إطار تدريب جديد يتبنى الوعي التركيبي (Composition-Aware Pretraining Framework)، حيث يركز هذا الإطار على ترميز خلطات الأراضي بشكل مشمول، مما يعني أن كل خلية من خلايا الصورة الساتلية يتم تمثيلها من خلال هيستوغرام يعكس توزيع الأنواع المختلفة للأرض.

لقد تم تصميم ما نسميه الهدف التركيبي (Composition Target) ليكون الهدف الأساسي للتنبؤ. هذا الهدف يتم تقليصه إلى العمود الفقري للنموذج باستخدام مسافة ناشئة الأرض (Earth Mover's Distance). ومن خلال تقييمات تجريبية، أظهرت نتائج هذا التدريب التركيبي زيادة ملموسة في فعالية النموذج في مهام فهم المنطقة، بما في ذلك استرجاع الصور دون تدريب سابق وتصنيف المشاهد.

علاوة على ذلك، فقد أثبت الإطار الجديد الأداء الجيد في المهام التي تتطلب دقة مكانية دقيقة مثل تقسيم الصور واكتشاف الكائنات. فمن خلال استخدام العمود الفقري المكون من 36.8 مليون معلمة، تجاوز نموذجنا أداء نماذج مثل SatMAE وPrithvi-EO-2.0، والتي تحتوي على 303 مليون و600 مليون معلمة على التوالي، في معظم إعدادات الاسترجاع وتصنيف المشاهد.

وعلى مجموعة بيانات ForestNet-12، التي تعتبر اختباراً صارماً للتمييز التركيبي، زاد نهجنا من معدل الدقة (mAP) في الترتيب الأول من 0.279 إلى 0.434، مما يمثل تحسنًا نسبيًا قدره 55.6%، وهو ما يقدم دليلاً مباشراً على فعالية نمذجة التركيب.

للمزيد من التفاصيل يمكنكم الاطلاع على الكود المُنفذ لهذا الإطار عبر Github. من المؤكد أن هذه التطورات ستعزز من قدراتنا في مجالات استكشاف الأرض ورصدها عبر التقدم في نماذج الذكاء الاصطناعي.