في عالم الاستشعار عن بُعد، أصبحت تقنيات التعلم المتباين بين اللغة والصورة (CLIP) تتصدر الساحة كأداة رئيسية لفهم الصور والنصوص المرتبطة بها. لكن المستخدمين واجهوا تحديات كبيرة، حيث أن الأساليب الحالية تعتمد بشكل أساسي على نماذج CLIP المصممة للتحليل بناءً على الصور الملونة RGB، بينما يظل استغلال الأجهزة المتنوعة مثل الرادار (SAR) والتصوير متعدد الأطياف (MSI) والتصوير الهيبري (HSI) تحديًا كبيرًا.

لكي نتجاوز هذه القيود، قمنا بتقديم OmniRSCLIP، وهو إطار عمل شامل يتيح التعلم المتباين الذي يدعم مدخلات متعددة المصادر من أجهزة الاستشعار. الفكرة الرئيسية هنا هو توسيع CLIP ليشمل واجهات إدخال غير محدودة، مع الإبقاء على المعرفة البصرية المدربة مسبقًا. لتحقيق ذلك، تم تقديم طريقة تحليل جديدة تُعرف باسم تحليل الأساس الطيفي-المكاني (Spectral-Spatial Basis Decomposition - SSBD). هذه الطريقة تعيد صياغة مشكلة التكيف بين النطاقات المختلفة كمشكلة إعادة تركيب الأساس.

تعمل OmniRSCLIP على توفير أساسات مكانية قابلة للنقل من خلال نموذج PATCH المدرب مسبقًا من CLIP، بينما تغطي العوامل المشروطة حسب الأطوال الموجية مجالات الانطباق الخاصة بكل جهاز استشعار في فضاء بصري مُقيد. تساعد هذه التصميمات في تجنب الإصرار على إدخال أجهزة استشعار متنوعة في فضاء إدخال ثابت، مع تمكينها من التوحد في فضاء دلالي مشترك للصورة والنص.

أيضًا، تم إدخال نظام تعلم متباين قائم على القناع الواعي بالسياق الطيفي بهدف تقليل الميزات الزائدة الخاصة بكل نمط وتسهيل مطابقة الصور والنصوص بشكل دقيق. لتحسين التدريب متعدد الأنماط، تم تطوير مجموعة OmniRS5M، وهي أول قاعدة بيانات كبيرة تغطي الصور والنصوص المتعلقة بالأجهزة RGB وSAR وMSI وHSI.

أظهرت التجارب على استرجاع البيانات والتصنيف من دون تدريب مسبق والموقع الدلالي أن OmniRSCLIP يحافظ على أداء قوي في نطاق RGB أثناء توسيع CLIP بنجاح إلى أنماط استشعار متباينة. هذا الابتكار يمكن أن يسهم في تطوير أدوات أفضل وأكثر كفاءة في مجال الاستشعار عن بُعد، مما يوفر فهماً أعمق للبيانات المتنوعة.