مع تزايد الاعتماد على أنظمة الذكاء الاصطناعي في فهم الوثائق الغنية بالمحتوى، تواجه هذه الأنظمة تحديات كبيرة في قراءة وفهم المعلومات الموزعة على صفحات متعددة. تعتبر الدراسة الجديدة التي تم نشرها في arXiv تحت عنوان "الكشف عن أخطاء فهم الوثائق الغنية بصرياً: دراسة تجريبية" خطوة هامة في هذا الاتجاه.

تشير النتائج إلى أن أنظمة فهم الوثائق متعددة الصفحات (MP-VRDU) تحتاج إلى إدارة الأدلة الموزعة على الصفحات، والتي في كثير من الأحيان تتجاوز قدرة النماذج الحالية. لقد تم تحديد ثلاثة أنماط رئيسية للفشل: تمثيل المعلومات، اختيار الأدلة، واستدلال المعاني. هذه الأنماط يمكن أن تؤدي إلى إجابات غير دقيقة، مما يؤكد على ضرورة تحسين كيفية بناء هذه الأنظمة.

عندما يتعلق الأمر بمعالجة المعلومات، فقد كشفت النتائج أن الرؤية (Vision) ضرورية، لكنها لا تستطيع استبدال استخراج النصوص (Text Extraction). حيث تؤثر الصفحات المفقودة بشكل كبير على دقة النتائج، بينما لا تكلّف العناصر المشتتة الكثير من الدقة.

تأتي النتائج بدليل لبناء أنظمة أكثر فعالية بميزانية حسابية ثابتة، حيث يمكن أن تؤدي العمليات المحفزة إلى تغيير سلوك الاستدلال بشكل كبير، مما يحسن بعض النتائج على حساب أخرى. بالنظر إلى هذه الإحصائيات، يصبح من الضروري أن نعيد التفكير في كيفية تطوير أنظمة الذكاء الاصطناعي لمعالجة الوثائق الغنية بشكل يناسب احتياجات المستخدمين.