في عالم الذكاء الاصطناعي، يعد الاكتشاف المتعدد للأجسام (Multi-modal Object Detection) أمرًا حيويًا لفهم المشهد بشكل قوي، خصوصًا في الظروف الصعبة مثل الإضاءة المنخفضة أو البيئات المليئة بالتحديات. في هذا السياق، ظهرت نماذج الرؤية القوية مثل DINOv3، التي أظهرت قدرات تمثيلية قوية. ومع ذلك، لا تزال هناك صعوبات في تعديلها لتلبية احتياجات السيناريوهات متعددة الأنماط.
تعمل الاستراتيجيات الحالية لدمج الأنماط عبر الأبعاد المختلفة على إجبار هذه الأنماط المتنوعة على التفاعل بشكل غير مميز، مما قد يؤدي إلى إدخال معلومات زائدة ويؤثر سلبًا على التمثيلات القبلية المدربة مسبقًا. لمواجهة هذه المشكلة، قام الباحثون بإعادة تقييم دمج الأنماط من منظور التعلم الاجتماعي، حيث تم اقتراح A2DINOv3، وهو إطار تعاون متعدد الخبراء مع بروتوكول تعاون اجتماعي (Socialized Collaboration Protocol - SCP).
يتمثل الابتكار الرئيسي في تمثيل فروع الألوان الحقيقية (RGB) والأشعة تحت الحمراء كخبراء متنوعين يحتفظون بمعرفتهم المتخصصة بينما يتبادلون المعلومات التكميلية من خلال تفاعلات انتselective ومقيدة. هذا التصميم يسهم في التخفيف من التداخل الضار بين الأنماط ويمنع تدهور المعلومات القبلية المدربة أثناء التكيف.
علاوة على ذلك، تم تقديم استراتيجية تهيئة صفريّة لتفعيل التعاون بين الأنماط تدريجيًا، مما يسمح بانتقال سلس من التعلم الفردي إلى التعلم التعاوني للتمثيل. وقد أظهرت التجارب المكثفة على أربعة مؤشرات متعددة الأنماط، بما في ذلك الكشف الجوي (GAIIC) وقيادة السيارات الذاتية (FLIR) والمراقبة في الإضاءة المنخفضة (LLVIP) وسيناريوهات العالم الحقيقي المتنوعة (M3FD)، أن A2DINOv3 يحقق باستمرار أداءً رائدًا في اكتشاف الأجسام المتعددة.
A2DINOv3: ثورة جديدة في اكتشاف الأجسام المتعددة من خلال التعاون الاجتماعي
تقدم A2DINOv3 نموذجًا ثوريًا في اكتشاف الأجسام المتعددة، من خلال دمج التعلم الاجتماعي لتحسين الفهم في البيئات الصعبة. التجارب تثبت تفوقه في أداء اكتشاف الأجسام مقارنة بالنماذج السابقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
