في عالم الذكاء الاصطناعي، تواصل نماذج الرؤية-اللغة (Vision-Language Models) مواجهة تحديات في المهام التي تتطلب فهماً بصرياً معقداً. معظم هذه النماذج تعاني من مشكلة رئيسية تتعلق بعدم قدرتها على تحديد التفاصيل الحاسمة في الصورة، مما يؤدي إلى استنتاجات غير صحيحة رغم أنها تبدو منطقية.

في هذا السياق، تم تقديم إطار عمل جديد يسمى "Locator-Critic"، أو LOCI، والذي يُعنى بتفكيك عملية البحث البصري عن الدليل من عملية التحقق من صحته. يعتمد LOCI على وكيل Locator يقوم باقتراح أدلة بصرية محتملة، بينما يتولى وكيل Critic مهمة تقييم مدى ملاءمة وكفاية هذه الأدلة.

تشتمل العمليات بين الوكلاء على حلقة تحسين متكررة، تعزز الدليل بشكل تدريجي حتى يصبح كافياً للإجابة على السؤال المطروح. هذا الأسلوب المفكك والذي يتمتع بقدرة على التصحيح الذاتي يُظهر زيادة ملحوظة في الأداء، حيث حقق نتائج ممتازة على عدة معايير بصرية متقدمة.

أظهر LOCI تحسيناً مهماً في الدقة لنماذج ذات أوزان مفتوحة مثل Qwen3-VL، حيث تحقق زيادة بنسبة +12.1 على V*، و+5.8 على HR-Bench، و+11.2 على VisualProbe-Hard. كما حققت النماذج المملوكة مثل Gemini 2.5 Pro زيادة بنسبة +8.9 على V* و+4.3 على HR-Bench و+4.8 على VisualProbe-Hard.

باختصار، LOCI هو الخطوة التالية في تطور نماذج الرؤية-اللغة، يمثل حلاً مبتكراً يعالج الفجوات الحالية، ويضع معياراً جديداً لتحسين الأداء.