يواجه نموذج اللغة والرؤية (Vision-Language Models - VLMs) تحديات كبيرة في أداء المهام البصرية مثل الفهم المكاني والتعرف على الزوايا، ويرجع ذلك بشكل أساسي إلى القيود المفروضة على بيانات الصور الطبيعية التي توفر إشرافاً محدوداً لمهارات الرؤية الأساسية. في إطار هذا السياق، أطلِق VisionFoundry، وهو أنبوب تلقائي جديد يستجيب لتحديات تلك المهام.

تختصر فكرة VisionFoundry في إمكانية استخدام إشراف مصطنع موجه لمعالجة تلك الضعف، من دون الحاجة إلى صور مرجعية أو توضيحات يدوية. يتمثل دور هذا النظام في استقبال اسم المهمة كمدخل، واستخدام نماذج اللغة الكبيرة (Large Language Models - LLMs) لتوليد أسئلة وإجابات مرافقة، بالإضافة إلى تحفيزات تحويل النص إلى صورة (Text-to-Image - T2I). بعد ذلك، يتم استخدام نماذج T2I لإنشاء صور جديدة، ويُعتبر نظام التصفية متعدد النماذج (Multimodal Verification) جزءاً حيوياً من العملية.

في إطار هذا الابتكار، تم بناء مجموعة بيانات خاصة تدعى VisionFoundry-10k، والتي تشمل 10 مهام إدراكية. أظهرت التجارب أن تحسين الأداء على مجموعة بيانات VisionFoundry-10k أدّى إلى تغذية النتائج بشكل كبير، حيث تفوقت على المعايير البصرية بمعدلات زيادة تقدر بـ6.7% على MMVP-pair و10.5% على CV-Bench-3D لنموذج Qwen2.5-VL-3B-Instruct. علاوة على ذلك، أظهرت الدراسة أن هذا النوع من الإشراف المصطنع يعزز أيضاً التعلم المعزز (Reinforcement Learning - RL) عبر كافة نماذج البيانات المفتوحة.

باختصار، يسلط هذا البحث الضوء على فعالية نظام الإشراف الآلي المصطنع كوسيلة قابلة للتوسع نحو تدريب شامل وفعّال لنماذج اللغة والمرئيات (VLMs). وبالتالي، يتوقع الباحثون بعد هذا الابتكار تعزيز مهارات النماذج البصرية بشكل ملحوظ وتوسيع تطبيقاتها المستقبلية.