في عالم الذكاء الاصطناعي، تظهر الحاجة المتزايدة لطرق فعّالة لاسترجاع المعلومات من الوثائق الطويلة، وخاصة تلك التي تتعلق بالشؤون المالية مثل بيانات الميزانية والتقارير المالية. حتى السنوات الأخيرة، كانت الأساليب السائدة تعتمد على تجزئة النصوص، واستخراج الكتل الأكثر قرباً من الاستعلام المستخدم. ومع ذلك، أظهرت الأبحاث الأخيرة، بما في ذلك دراسة جديدة تم نشرها، أن هذا النهج قد يكون غير ملائم للعديد من الوثائق الهامة.

توضح الدراسة أن 86.8% من محتوى تقرير حكومي من 780 صفحة يشمل صفوف من الجداول، حيث تتنافس الأرقام المتشابهة ضمن مجال واحد لم يتم فيه فرز الوحدات بشكل دقيق. هذا الأمر يمكن أن يؤدي إلى أخطاء جسيمة تصل إلى مرتبتين من حيث الحجم، مما يثير الحاجة لأساليب بحث تستند إلى فهم هيكلي أعمق.

لذا، اقترح الباحثون أسلوباً جديداً يعرف باسم READ (استرجاع الوثائق الوكيلة الموثوقة). تعتمد هذه الطريقة على ثلاث عمليات محددة القراءة: البحث المعجمي العادي، التنقل الهيكلي، والقراءة ضمن نطاق محدد. هذا يضمن أن مسار البحث يمكن تتبعه واضحاً، بدلاً من الاعتماد على نماذج معتمة.

عند اختبار READ، أجاب النموذج على 58.8% من الأسئلة التحقق منها، والفارق هنا ملحوظ مقارنة بأساليب البحث التقليدية التي حققت 15.7%. من خلال النظر في هيكلة الوثائق، تمكّن READ من تجاوز محدودية البحث المعتمد على التضمين. بهذا الشكل، لن يتم اعتبار المعلومات التي تعتبر بالغة الأهمية مجرد نقاط مشابهة فحسب، بل ستصبح جزءاً لا يتجزأ من عرض دقيق ومنظم للمعلومات.

في خاتمة هذا البحث، يمكن القول إن حماية دقة البيانات وتحسين قدرة استرجاع المعلومات في بيئات معقدة مثل المالية يمثل خطوة مهمة نحو مستقبل أكثر ابتكاراً وكفاءة.