في عالم الذكاء الاصطناعي، يعتبر الكشف عن الأهداف الصغيرة في الأشعة تحت الحمراء (IRSTD) مهمة معقدة تجمع بين تكنولوجيا الرؤية والتعلم العميق. وفي هذا الإطار، تعاني الطرق التقليدية التي تعتمد فقط على المعلومات على مستوى البكسل من صعوبة كبيرة في التفريق بين الأهداف والضوضاء المحيطة. وعندما يتعلق الأمر بالتقنيات متعددة الوسائط، فإن معظمها يبدأ بوصف الأهداف والخلفيات من خلال نص موحد، مما يؤدي إلى نقص حاد في التوجيه الإقليمي ورفض التعامل بنجاح مع التنوع الدلالي للأشعة تحت الحمراء.

لكن ماذا لو كانت هناك طريقة جديدة؟!

هنا تأتي بصمة الابتكار، مع تقديم شبكة ADGNet، التي تعتمد على مجموعة فريدة من التقنيات لمواجهة تلك التحديات. اعتماداً على الاختلافات الدلالية، تم تصميم مشبك ثنائي النصوص غير المتماثل (ADP)، الذي يتكون من نصوص تعبيرية عامة حول الأهداف، وتفاصيل دقيقة للخلفيات.

وتضم الشبكة أيضاً وحدة تفاعل ثنائية الفروع (ADBI) لتوجيه الخصائص البصرية بشكل منفصل، مما يحمي الأهداف من الضوضاء بينما يخفف من ازدحام الخلفيات.

من ناحية أخرى، تم إدخال وحدة تجميع الخصائص التكيفية (AFA) لدمج الخصائص بشكل ديناميكي، مما يعزز فعالية الكشف بشكل كبير.

للتأكد من قوة هذه التقنية، تم بناء مجموعة بيانات جديدة تُعرف باسم مجموعة بيانات الأشعة تحت الحمراء النصية غير المتماثلة (AITIR) بتعليقات نصية غير متماثلة لـثلاث مجموعات بيانات عامة (IRSTD-1K، NUDT-SIRST، وSIRST)، حيث أظهرت التجارب أن ADGNet تمكنت من التفوق على 21 طريقة حديثة جداً (SOTA).

لمن يرغب في استكشاف كود هذه الشبكة، يمكنكم زيارة رابط المشروع. مع قوة مثل هذه التقنية، نبدأ في اكتشاف إمكانيات جديدة للكشف عن الأهداف في بيئات قديمة ومعقدة!

ما رأيكم في هذا التطور اللافت؟ شاركونا آراءكم في التعليقات.