في عالم الذكاء الاصطناعي الذي يشهد تطورات سريعة، تجذب نماذج اللغة متعددة الوسائط (MLLMs) الأنظار بفضل أدائها المذهل في السيناريوهات البسيطة. ومع ذلك، توجد تحديات كبيرة في المشاهد الحضرية المعقدة، حيث يمكن أن تتدهور موثوقية استخدام هذه النماذج بشكل كبير بسبب الظروف السلبية. في العديد من تلك الحالات، تعتمد الأنظمة على استنتاجات ضمنية دون وجود دلائل بصرية كافية، مما يؤدي إلى عدم التوافق بين الإدراك والاستنتاج.
لمعالجة هذه الفجوة، قدم الباحثون مقياس AD2-Bench الذي يقدم إطار تشخيص بصري هرمي يقوم بتفكيك الاستنتاج إلى سلسلة من الأدلة المنهجية (Chain of Evidence - CoE). هذا التشخيص الدقيق يكشف أن الاستنتاج المتين يعتمد بشكل أساسي على دقة الحصول على الأدلة.
تبنى المؤلفون منظورًا احتماليًا لتحديد سببين رئيسيين لفشل الاستنتاج: الارتباك المكاني، حيث تفشل النماذج في تمييز الأجسام المستهدفة عن الفوضى الخلفية، مما يؤدي إلى أخطاء في تحديد الموقع؛ وعدم اليقين الدلالي، حيث تؤدي الخصائص البصرية المتدهورة إلى تفسيرات دلالية خاطئة، مما ينتج عنه أخطاء فهم.
لتجاوز نقص الأدلة، اقترح الباحثون فكرة الاستنتاج البصري القائم على الأدلة (EGVOR)، الذي يستبدل الاستنتاج الضمني بإنشاء أدلة واضحة - ثلاثيات بصرية-دلالية منظمة تربط بين الموقع والفهم الدلالي بدقة. يتم تدريب النموذج من خلال منهج تدريجي هرمي يشمل الانتقال من التعلم بالإنعكاس إلى التعلم المعزز، حيث يتم مكافأة تقليل تباين الاستنتاج بشكل صريح.
تشير التجارب الواسعة أن EGVOR يحسن بشكل ملحوظ من استقرار الاستنتاج تحت الظروف السلبية، مما يوفر إطار عمل أكثر موثوقية للمعرفة متعددة الوسائط.
ما رأيكم في هذا التطور؟ شاركونا في التعليقات!
تطور جديد في الذكاء الاصطناعي: تقييم موثوق للذكاء متعدد الوسائط في مشاهد حضرية معقدة 🌆
تم الكشف عن إطار جديد لتحسين موثوقية نماذج الذكاء الاصطناعي متعددة الوسائط (MLLMs) في السيناريوهات المعقدة. يهدف هذا الابتكار إلى تعزيز دقة اتخاذ القرار من خلال معالجة العوامل التي تؤثر على الفهم البصري.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
