تعد الوثائق الغنية بصرياً مثل التقارير والعروض التقديمية والأدلة من أكثر الصور تعقيداً في فحص المعلومات، حيث تتوزع الأدلة عبر عدة صفحات وتختلط فيها النصوص مع إشارات التنسيق والجداول والرسوم البيانية. في خطوة مبتكرة، تم تقديم VLD-RAG، وهو إطار يدمج بين استرجاع المعلومات وتوليد الإجابات بجوانب متعددة، مخصص للإجابة عن الأسئلة المتعلقة بهذه الوثائق الطويلة الغنية بصرياً.
يعمل VLD-RAG على بناء فهرس مؤسساتي يحافظ على صفحات الوثيقة، حيث يخزن النصوص المعالجة وبيانات التعريف على مستوى الصفحة والتمثيلات البصرية المتعمقة. كما أنه يستخدم استراتيجية استرجاع هجينة تجمع بين البحث القائم على الكلمات الرئيسية والبحث الدلالي العميق لتحديد المصادر المرشحة وصفحات الأدلة. تتمثل وظيفة هذا الإطار في تحسين تغطية الأدلة وكشف الاقتباسات المفقودة، حيث يقوم بتنسيق العمل بين ثلاثة عوامل: وكيل الاسترجاع ووكيل الإجابة ووكيل التحقق.
لقد أظهرت النتائج أن VLD-RAG يحسن من دقة استرجاع الصفحات الأدلة والقدرة على الإجابة على الأسئلة النهائية في معايير الأداء مثل LongDocURL وMMLongBench-Doc، متفوقاً على الطرق السابقة المرجعية المعتمدة على الرؤية. تؤكد هذه النتائج على أهمية التحقق المنسق بين العوامل واسترجاع المعلومات الهجينة متعددة الأنماط لضمان موثوقية الإجابات الصحيحة عندما تعتمد على أدلة متفرقة عبر الصفحات.
ومع استمرار تقدم تقنيات الذكاء الاصطناعي، يصبح من الواضح أن التطورات مثل VLD-RAG ليست مجرد تحسينات تقنية، بل ثورة حقيقية في كيفية التعامل مع المعرفة البصرية، مما يفتح آفاقًا جديدة أمام الباحثين والمهنيين على حد سواء.
ثورة جديدة في استرجاع الوثائق البصرية: VLD-RAG لتوليد الإجابات الذكية!
تقدم VLD-RAG إطارًا مبتكرًا يجمع بين استرجاع المعلومات والتفكير عبر الصفحات في الوثائق البصرية الطويلة. هذه التقنية تعزز دقة استرجاع الأدلة، مما يسهل الإجابة على الأسئلة المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
