في عالم الذكاء الاصطناعي، تعد دقة الإجابات على الأسئلة المتعلقة بالصور عالية الدقة تحديًا كبيرًا، خاصة عندما يفشل النموذج المتعدد الأنماط في اكتساب الدلائل الدقيقة والمكانية اللازمة للإجابة الصحيحة. ومع ذلك، فإن تقنية البحث البصري المتوازي (Visual Parallel Search - VPS) تقدم حلاً مبتكرًا لهذا التحدي.
تعتمد تقنية VPS على إطار عمل فريد حيث يستدعي وكيل رئيسي فحص مناطق محددة من الصورة في وقت واحد باستخدام عملاء فرعيين مخصصين للأسئلة. هذا يعني أن النموذج لا يختار منطقة معينة قبل الحصول على نظرة شاملة عن الصورة، مما يعزز فرصة الكشف عن التفاصيل الهامة.
وفقًا للنتائج، فإن تقنية VPS قد حسنت دقة الإجابات بنسبة تصل إلى 8 نقاط، مع مكاسب تم تسجيلها في 14 من أصل 15 مقارنة مع نماذج تقليدية تعتمد فقط على التكبير. كما أظهرت فيه منصة ZoomBench زيادة ثابتة بنحو 3.2 نقطة عبر جميع الأحجام المختبرة.
تعتبر آلية التعليم في هذه التقنية مبتكرة، حيث تستخدم عملية تحقق خالية من التلميحات ونموذج دعم للتعلم في الأدوار. مما زاد من دقة النماذج عبر مجموعة من القياسات المختلفة، بما في ذلك زيادة بـ 4.17 نقطة في اختبار HR-Bench 4K.
تفسير النتائج يكشف عن عدم تناسق بين قراءة الدلائل المحلية والتحكم في البحث العالمي، مما يدعم في النهاية فائدة VPS كدعامة وقت الاستدلال وكنموذج تدريبي قوي لاستحواذ المعلومات البصرية.
إعادة تعريف البحث البصري: اكتشاف الصور عالية الدقة باستخدام إطار عمل البحث المتوازي
تقدم تقنية البحث البصري المتوازي (VPS) منهجية جديدة لتحسين دقة الإجابات البصرية على الأسئلة عالية الدقة. تعتمد هذه التقنية على فحص الصور في وقت واحد، مما يعزز نتائج النماذج الاصطناعية للحصول على معلومات دقيقة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
