تواجه عمليات الاسترجاع التقليدية للوثائق الغنية بصريًا (Visually Rich Documents) العديد من التحديات، إذ غالبًا ما توجد المعلومات الهامة في الجداول والنماذج والرسوم البيانية، مما يجعلها عرضة للفقدان أو التشويه في عمليات التعرّف على الأحرف (OCR). ولكن الآن، تقدم عائلة أنظمة ColPali العصرية حلاً مبتكرًا عبر تعزيز الفهارس متعددة المتجهات على مستوى القطع، مما يحافظ على فعالية الاسترجاع المدفوعة بواسطة الصور خلال وقت الاستعلام.

الآن، معنا نظام MIDR (Multimodal Indexing for Document Retrieval)، الذي يمثل إطار عمل خالٍ من التدريب، قادر على إحداث ثورة في كيفية معالجة الاستعلامات متعددة الوسائط. عند إدخال البيانات، يقوم نموذج لغوي كبير (Large Language Model) بتحويل الصفحات المعروضة إلى حقول نصية موثوقة يتم فهرستها باستخدام BM25F، مع إمكانية دمجها مع تقنيات الاسترجاع الكثيفة، ما يمكّن من تقديم بيانات نصية مرتكزة على الأدلة المتعددة الوسائط.

وفقًا للنتائج المتوفرة على مجموعة بيانات ViDoRe V3، يُحقق نظام MIDR Hybrid متوسط مقياس دقة النتيجة الموزونة (nDCG) 0.6219 عبر خمسة مجالات إنجليزية، مع تحسين بنسبة 23.0% مقارنةً بنظام BM25، مما يجعله منافسًا قويًا لنموذج ColQwen2.5. أما بالنسبة للغات الأخرى مثل الفرنسية، فتساعد تقنيات التعزيز في جسر الفجوة بين الاستعلامات الإنجليزية ونصوص الصفحات الفرنسية، مما يرتقي بمؤشر BM25 من 0.1532 إلى 0.5448.

خلاصة القول، إن MIDR لا يسجل فقط تقدمًا ملحوظًا في الأداء، بل يقلص أيضًا حجم الذاكرة المستخدمة لتكون نحو 9 مرات أصغر، كما يقلل زمن الاستعلام بنحو الضعف. وبينما يفتح هذا النظام آفاقًا جديدة في استرجاع المعلومات، فإنه يُعد خيارًا مثيرًا للتفكير في مستقبل الفهرسة متعددة الوسائط.