في عالم الذكاء الاصطناعي، يعد نموذج تقسيم المشاهد "Segment Anything Model" (SAM) من أبرز التقنيات المستخدمة، غير أن اعتماده على بيانات RGB فقط قد يحد من فعاليته في ظروف الإضاءة المعقدة مثل الإضاءة المنخفضة أو الظروف البيئية القاسية. ولتجاوز هذه القيود، تم تطوير إطار جديد يُعرف بـ "SARTM" والذي يركز على تسخير قوة SAM لتمكين تقسيم دلالات RGB-حرارية (RGB-T) بكفاءة.
إحدى الأفكار الرئيسية للإطار هي تحسين SAM الأصلي بإضافة طبقات LoRA إضافية، مما يضمن الحفاظ على قدرته على التعميم والأداء في المهام التالية. علاوة على ذلك، يتم توظيف المعلومات اللغوية كإرشاد خلال تدريب SARTM، من خلال استخدام وحدة "Cross-Modal Knowledge Distillation" (CMKD) التي تساعد في تحقيق التكيف بين الأنماط المختلفة.
كما تم تعزيز تجربة التقسيم من خلال تعديل رأس التقسيم لـ SAM وإضافة رأس إضافي للتقسيم الدلالي، مما يتيح دمج الميزات متعددة المقاييس بطريقة فعالة. وللتأكد من فعالية SARTM، تم إجراء تجارب واسعة النطاق عبر ثلاثة معايير لتقسيم RGB-T، وهي MFNET وPST900 وFMB. وخلصت النتائج الكمية والنوعية إلى أن SARTM يتفوق بشكل ملحوظ على النماذج المتاحة حاليًا في مجموعة متنوعة من الظروف.
هذا التطور التكنولوجي قد يغير قواعد اللعبة في كيفية فهم وتفسير المشاهد تحت ظروف الإضاءة المتنوعة. للمزيد من المعلومات، يمكنك زيارة GitHub الخاص بالمشروع. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.
اكتشاف قوي: SARTM لنمذجة المقاطع الحرارية RGB مع دعم اللغة
تمكن سارتيم (SARTM) من تحسين تقنية تقسيم المشاهد في ظروف الإضاءة السيئة من خلال دمج نماذج الفهم الدلالي. يعد التطور الجديد خطوة قوية نحو تعزيز قدرات النماذج السابقة في التعامل مع البيانات المتعددة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←# Segment Anything Model# SARTM# RGB-T# Cross-Modal Knowledge Distillation# التعلم العميق# تقسيم الصور
جاري تحميل التفاعلات...
