في عالم تكنولوجيا الذكاء الاصطناعي، تُعتبر نماذج الرؤية واللغة (Vision-Language Models) من أروع الابتكارات التي تسعى إلى الإجابة على الأسئلة المتعلقة بالصور. على الرغم من نجاحها في العديد من الحالات، إلا أنها في بعض الأحيان تواجه صعوبة في تلقي الأجوبة الدقيقة على الأسئلة المعقدة التي تتطلب تفاصيل بصرية دقيقة أو معرفة خارجية.

للتغلب على هذه التحديات، تُستخدم نماذج الرؤية واللغة أدوات مثل قص الصور (image cropping) والبحث عن الصور (image search) والبحث النصي (text search). لكن، الطريقة الحالية لتدريب هذه النماذج تعتمد بشكل أساسي على تقييم دقة الإجابات النهائية، مما يترك مسألة جمع واستخدام الأدلة غير مشرف عليها بالشكل الكافي.

وترتبط هذه العملية بمشاكل خطيرة حيث: (1) كثيرًا ما تصدر النماذج استدعاءات أدوات مكررة أو غير مركزة تفشل في جمع الأدلة الضرورية، و(2) حتى عند استدعاء الأدوات المناسبة، تفشل النماذج غالبًا في استخراج المعلومات المطلوبة من الملاحظات الناتجة.

لحل هذه المشكلات، تم تقديم نظام جديد يسمى NTEP (Necessary Tool-Evidence Path)، والذي يمثل مخططًا جديدًا للتعليقات يصيغ الأدلة الخارجية الأساسية اللازمة لكل استفسار. وبناءً على هذا النظام، نقترح آلية إشراف جديدة تُعرف بـ NTEP-R (NTEP Reward)، تهدف لضمان أن كل استدعاء للأداة يعزز العملية التحليلية نحو الحل النهائي.

إن هذا النهج يُكافئ النموذج على توجيه نواياه نحو جمع الأدلة بطريقة هادفة، ويضمن أن المعلومات المستخلصة تتوافق مع الأدلة الضرورية. وعلى الصعيد الآخر، تم تضمين منظم غير مكرر للأهداف يعاقب الاستدعاءات الزائدة التي تعيد زيارة الأهداف المُرضاة.

ورغم كل التحديات، فقد أثبتت التقييمات المكثفة على سبعة معايير معتمدة على الصور أن تطبيق NTEP-8B، والذي يحتوي على 8 مليارات معلمة، يعزز كفاءة استخدام الأدوات ودقة البحث بشكل ملحوظ ضمن إطار عمل موحد. تُظهر هذه النتائج القيمة الكبيرة للإشراف الدقيق على مسارات الأدلة والأدوات في تدريب نماذج VLM القوية.