تعتبر أنظمة البحث متعددة الوسائط (Multimodal Agentic Search) آداة أساسية تتيح الإجابة على الأسئلة البصرية المعقدة من خلال الاعتماد على أدوات خارجية. إلا أن التقييمات الحالية تركز بشكل كبير على دقة الإجابات النهائية، مما قد يغفل مشكلات خفية خاصة بالفشل الصامت (Silent Failures) خلال مسار البحث.

في دراسة حديثة، تم تحليل هذه الإشكالات واكتشاف مجموعة من المشكلات التي تصنف إلى ست فئات مختلفة، تشمل:

1. **اختصارات الوسائط**: الاعتماد الزائد على نوع واحد من المدخلات.
2. **تثبيت غير حقيقي**: معلومات غير دقيقة تؤدي إلى استنتاجات خاطئة.
3. **دلائل خاطئة ولكن الإجابات صحيحة**: حيث تكون الإجابة صحيحة، لكن الأدلة المستخدمة غير صحيحة.
4. **تنظيف الإفراط في الاسترجاع**: التعامل مع معلومات زائدة قد تكون مضللة.
5. **تناقضات عبر الوسائط**: حالات تتعارض فيها المعلومات عبر مدخلات متعددة.
6. **هلوسة الأصول**: حيث تظهر بيانات غير موجودة في الواقع.

استندت الدراسة إلى هذه التصنيفات لتطوير خط أنابيب تشخيصي يقيم دقة الإجابات وجودة الأدلة على مستوى المسار بشكل موحد. وُجد أن دقة المظهر (Surface Accuracy) لا تعكس دائمًا الصحة الحقيقية للمسارات، مما يدل على أهمية التحقق من فشل الصمت الذي يعتمد على القدرات.

تظهر التجارب التي أجريت على نماذج متعددة الوسائط الرائدة أن هذه الفشل غالبًا ما يتحول بدلاً من أن يختفي، مما يدعو إلى مراجعة شاملة لكيفية تقييم هذه الأنظمة. يمكن الاطلاع على المزيد من التفاصيل في الرابط.