في عالم التكنولوجيا المتقدمة، يعتبر التعرف التلقائي على الأهداف (ATR) باستخدام السونار المصطنع (Synthetic Aperture Sonar - SAS) عنصرًا أساسيًا لتمكين قدرات بحرية متطورة. ومع ذلك، يواجه التعلم العميق قيودًا تتعلق بنقص الصور المستهدفة، والتشويش الخلفي، وتقييم البشر. لحل هذه المشكلة، تم تعديل نماذج محولات رؤية DINOv3 (Vision Transformer - ViT) لاستخدامها في التعرف تحت الماء باستخدام إطار عمل فعال يبلغ ثلاث مراحل.

تبدأ المرحلة الأولى باستخدام تقنية التكيف ذو التصنيف المنخفض (Low-Rank Adaptation - LoRA) مع تثبيت الهيكل الأساسي لنموذج ViT، مما يتيح سد الفجوة بين التدريب المسبق على الصور الطبيعية وانتشار الصوت تحت الماء.

أما في المرحلة الثانية، فإننا نستعين بتقنية استخراج السلبيات الصعبة (hard-negative mining) لتعزيز الحدود الفاصلة ضد المحاكيات الصوتية، مثل الصخور والترسبات التي تشبه الأهداف التي صنعها الإنسان. وفي المرحلة الثالثة، نطبق التعلم التبايني الخاضع للإشراف (Supervised Contrastive Learning - SupCon) لفصل تمثيلات الأهداف والتشويش.

لقد تم تقييم البيانات التي تم جمعها في البحر باستخدام تقسيم جغرافي على مستوى المهمة، حيث تم مقارنة جميع الأذرع مع نسبة استرجاع اختبار بلغت 85%. وقد أظهرت النتائج أن LoRA لعبت دورًا رئيسيًا، حيث زادت المساحة تحت منحنى الدقة-الاسترجاع (AUPRC) من 0.300 إلى 0.679 ± 0.027 باستخدام نفس الهيكل الثابت. وكانت النتيجة قد تحققت بينما تم تدريب 0.26% فقط من الأوزان.

في الخلاصة، تشير النتائج إلى أن مرحلة التكيف الفعالة الوحيدة تكفي لتحقيق النتائج المرجوة، دون الحاجة إلى تكديس مراحل التحسين المتعددة.