في عالم اليوم المليء بالبيانات، تعتبر المعلومات المعقدة جزءًا أساسيًا من فهمنا للعديد من المواضيع. ولكن، كيف يمكننا استخراج هذه المعلومات بفعالية من المستندات الطويلة؟ هذا هو التحدي الذي تواجهه تقنيات مثل DocVQA، التي تركز بشكل أساسي على تقديم إجابات نصية أو تحديد مناطق معينة.

لتجاوز هذه القيود، تم تقديم مفهوم جديد يتمثل في الاستخراج المدفوع بالاستعلام (Query-Driven Extraction) من مستندات متعددة الوسائط. الجانب المبتكر هنا هو أن النماذج تحتاج إلى تقديم قيم نصية مطلوبة بناءً على الاستعلامات، بالإضافة إلى تحديد مربعات الصور المرتبطة بتلك القيم.

لتطبيق هذه الفكرة، تم إنشاء تصنيف ذي مستويين ينظم استراتيجيات الاستخراج بناءً على نية المستخدم ومحتوى المستند. ما يميز هذا النهج هو الاعتماد على معيار جديد يسمى ITJoint، الذي يتضمن مجموعة من المستندات الفنية المعقدة مع تسجيلات للصور، مما يجعل النتائج أكثر دقة وملائمة.

لقد تم تقييم عدة نماذج معروفة في مجال رؤية اللغة (Vision-Language Models) من مزودين مختلفين، وأظهرت النتائج أن هذه النماذج تواجه تحديات معينة في تنفيذ هذه المهمة. لكن مع تطوير إطار عمل Q2IT، المتكون من ثلاثة وكلاء تعمل معًا لجمع الأدلة وتحديد الصور المستهدفة، تم تحقيق تحسين ملحوظ في الأداء. على الرغم من ذلك، لا يزال هناك فجوة كبيرة نحو تحقيق النتائج المثالية.

هذا الابتكار يمهد الطريق لفهم أفضل للمعلومات المعقدة ويشكل خطوة كبيرة نحو تطوير تقنيات الذكاء الاصطناعي التي تستفيد من مستندات متعددة الوسائط.