في عالم يتزايد فيه الاعتماد على نظام استرجاع الوثائق المرئية، تبرز تقنية جديدة تدعى ViSAR (استرجاع التنشيط الدلالي البصري) كحلاً مبتكرًا لتحقيق نتائج أفضل في معالجة أسئلة الوثائق. يعتمد هذا النهج المتقدم على تحسين أداء نماذج اللغة الكبيرة (Large Vision-Language Models) أثناء التعامل مع استفسارات المستخدم.

تتمثل المشكلة الرئيسية في الأساليب التقليدية، حيث تعتمد غالبًا على استرجاع عدد ثابت من الصفحات المهمّة، وهذا يُنهي بإبطاء أداء النموذج وزيادة زمن الاسترجاع دون تصحيح دقة الإجابة. ولكن مع ViSAR، تتمكن الأنظمة من إنشاء مصفوفة تشابه على مستوى الصفحة، مما يتيح لها تحديد الصفحات الأكثر صلة بالسؤال المطروح.

ويمتاز ViSAR بكونه طريقة استرجاع تكيفية بدون تدريب، مما يعني أن هناك إمكانية لضبط أداء الاسترجاع بشكل ديناميكي وفقًا لتعقيد الاستفسارات، مما يحقق تقليل الوقت اللازم للاسترجاع بمعدل تصل نسبته إلى 58.7%. وقد أظهرت الدراسات أن هيكل مصفوفة التشابه مرتبط بدقة الإجابات، مما يُنذر بمستقبل مشرق في جودة استرجاع الوثائق وفهمها.

باختصار، مع ViSAR، يدخل الذكاء الاصطناعي مرحلة جديدة من الفعالية والذكاء، ننتظر تطبيقاته وآثاره في المستقبل القريب.