في عالم الذكاء الاصطناعي، يعد نموذج تقسيم المشاهد "Segment Anything Model" (SAM) من أبرز التقنيات المستخدمة، غير أن اعتماده على بيانات RGB فقط قد يحد من فعاليته في ظروف الإضاءة المعقدة مثل الإضاءة المنخفضة أو الظروف البيئية القاسية. ولتجاوز هذه القيود، تم تطوير إطار جديد يُعرف بـ "SARTM" والذي يركز على تسخير قوة SAM لتمكين تقسيم دلالات RGB-حرارية (RGB-T) بكفاءة.

إحدى الأفكار الرئيسية للإطار هي تحسين SAM الأصلي بإضافة طبقات LoRA إضافية، مما يضمن الحفاظ على قدرته على التعميم والأداء في المهام التالية. علاوة على ذلك، يتم توظيف المعلومات اللغوية كإرشاد خلال تدريب SARTM، من خلال استخدام وحدة "Cross-Modal Knowledge Distillation" (CMKD) التي تساعد في تحقيق التكيف بين الأنماط المختلفة.

كما تم تعزيز تجربة التقسيم من خلال تعديل رأس التقسيم لـ SAM وإضافة رأس إضافي للتقسيم الدلالي، مما يتيح دمج الميزات متعددة المقاييس بطريقة فعالة. وللتأكد من فعالية SARTM، تم إجراء تجارب واسعة النطاق عبر ثلاثة معايير لتقسيم RGB-T، وهي MFNET وPST900 وFMB. وخلصت النتائج الكمية والنوعية إلى أن SARTM يتفوق بشكل ملحوظ على النماذج المتاحة حاليًا في مجموعة متنوعة من الظروف.

هذا التطور التكنولوجي قد يغير قواعد اللعبة في كيفية فهم وتفسير المشاهد تحت ظروف الإضاءة المتنوعة. للمزيد من المعلومات، يمكنك زيارة GitHub الخاص بالمشروع. ما رأيكم في هذا التطور؟ شاركونا في التعليقات.