في ظل التطور السريع الذي يشهده علم الذكاء الاصطناعي، نأتي اليوم للإعلان عن إنجاز جديد في مجال تحليل الصور الفضائية وهو تقنية تقسيم الصور المفتوحة المفردات (OVRSIS). هذه التقنية تعد فرعاً حديثاً من تقسيم الصور باللغة المفتوحة (OVS) وتعتمد بشكل كبير على التطبيقات الفضائية، ولكن تواجه تحديات ملحوظة بسبب عدم وجود معيار موحد للتقييم والفجوة بين صور الطبيعة وصور الريموت سينسينغ (Remote Sensing).

للمضي قدماً وتجاوز هذه العقبات، تم إطلاق معيار مرجعي جديد يسمى OVRSISBench، والذي يستند إلى مجموعة بيانات شائعة لتقسيم الصور الفضائية، مما يُمكن من تقييم دقيق ومتسق بين الطرق المختلفة المستخدمة. من خلال هذا المعيار، أُجري تقييم شامل للعديد من النماذج التمثيلية في مجال OVS وOVRSIS، حيث تم اكتشاف القيود الكبيرة لهذه النماذج عند تطبيقها مباشرة على صور الريموت سينسينغ.

بناءً على هذه الرؤى، تم تطوير نموذج RSKT-Seg، وهو إطار جديد لتقسيم الصور المفتوحة المفردات مخصص للصور الفضائية. يتضمن نموذج RSKT-Seg ثلاثة مكونات رئيسية تسهم في تحسين الأداء:
1. **نموذج تجميع تكلفة متعدد الاتجاهات (RS-CMA)**: الذي يلتقط الإشارات المرئية غير المتحيزة من خلال حساب التشابهات اللغوية البصرية عبر اتجاهات متعددة.
2. **تحويل تجميع تكلفة فعال (RS-Fusion)**: الذي يقوم بنمذجة الاعتماديات المكانية والدلالية بشكل مشترك باستخدام استراتيجية خفيفة لتقليل الأبعاد.
3. **نموذج نقل المعرفة في التصوير الفضائي (RS-Transfer)**: الذي يدعم نقل المعرفة المدربة مسبقًا ويساعد في تعزيز التكيف مع الفجوة بين المجالات من خلال تحسين عملية الرفع.

تظهر التجارب المتعددة التي أُجريت على المعيار المرجعي أن RSKT-Seg يتفوق بشكل متواصل على النماذج السابقة بمعدل تحسين يصل إلى +3.8 mIoU و+5.9 mACC، بالإضافة إلى تحقيق سرعة في الاستدلال تصل إلى ضعف سرعة النماذج السابقة عبر التجميع الفعال.

إذا كنت مهتمًا بتفاصيل أكثر، يمكنك الوصول إلى كود النموذج عبر الرابط هنا.