في عالم الذكاء الاصطناعي، تعتبر تقنيات استرجاع المعلومات متعددة الأبعاد من أهم العناصر لتحسين دقة الإجابات على الأسئلة المُعقدة. وقد أظهر النموذج الجديد ColGraphRAG تقدماً ملحوظاً في هذا المجال، حيث يستخدم تقنية متطورة لاسترجاع الأدلة من خلال تنظيم الصور، النصوص، والجداول في مخطط هيكلي.

مع الاعتماد التقليدي على طرق ترتيب تعتمد على تشابه المتجهات ذات البعد الواحد، كان من الممكن تفويت تفاصيل هامة في الهيكل المعقد للبيانات. لتحسين هذا الجانب، قام الباحثون بتجربة استخدام أسلوب MaxSim من سلالة ColBERT/ColPali لتحسين تصنيف الصور المرتبطة بالمخطط، مع الحفاظ على نظام استرجاع النصوص والجداول وتحليل البيانات كما هو.

أظهرت النتائج على قاعدة بيانات MultimodalQA تحسناً ملموساً في دقة المرحلة الاسترجاعية بالنسبة للصور المرتبطة بالمخطط، مما ساهم في تعزيز جودة الإجابات. وكانت الأمور مثيرة للاهتمام بشكل خاص حيثما كانت الأدلة البصرية تلعب دوراً حيوياً، على الرغم من وجود اتجاهات مختلطة في الأسئلة التي تعتمد على النص.

من الواضح أن هذه النتائج تبرز أهمية تضمين الأدلة البصرية المرتبطة بالمخطط، بينما يبقى التحقق الأوسع والتشخيص الدقيق على مستوى المخططات من الأعمال المهمة المستقبلية.