في عالم الذكاء الاصطناعي المتسارع، يعتمد وكلاء النماذج اللغوية الضخمة (Large Language Models) على أدوات الاسترجاع للوصول إلى المعرفة الخارجية. ومع ذلك، يواجه البحث البصري عوائق كبيرة نتيجة للاعتماد على مسترجعات المعلومات التقليدية التي تتطلب استعلامات نصية في كل خطوة. وهذا ما يجعل عملية البحث معقدة، خاصة عندما تكون القرائن البصرية صعبة الوصف أو عندما تفشل أدوات الاسترجاع التقليدية في تقديم الأدلة اللازمة.

لذا، قمنا بتقديم تقنية VHOP-Router، وهي نظام تدريب متكامل يغير نماذج الاسترجاع التقليدية إلى مسترجع متعدد الخطوات، مما يتيح للوكيل معالجة المعلومات مباشرة في الفضاء اللاتيني البصري. يقوم VHOP-Router بعمليات استرجاع الصورة المترابطة في استدعاء واحد للأداة، مما يجعله يختلف عن الأساليب السابقة.

ومن خلال تجاربنا، يظهر VHOP-Router زيادة ملحوظة في أداء الاسترجاع حيث ارتفعت النسبة من أقل من 5% إلى 76.3%. كما حسّن من معدلات النجاح في المهام بنسبة 52.7%، مع تقليل متوسط طول الرموز بنسبة 61%، من 1886 إلى 728.

بالإضافة إلى ذلك، يظهر VHOP-Router أداءً متفوقاً مقارنة بالنماذج التقليدية، حيث يدعم تقييم الصعوبة العامة والاختبارات الواقعية. تعتبر VHOP وVHOP-Router الحل الفعال والمبتكر للبحث البصري الذي يحافظ على قدرات النماذج اللغوية الضخمة بدون أي تأثير.