تواجه نماذج الرؤية-لغة (Vision-Language Models - VLMs) تحديات كبيرة في تحويل المشاهد البصرية إلى رسومات متقدمة قابلة للتعديل. تعد توليد رسومات SVG (Scalable Vector Graphics) المعقدة من أبرز تلك التحديات. حيث تقتصر الطرق الحالية على إنتاج مجموعات مسطحة من المسارات، مما يجعل تعديل العناصر الفردية عملية شاقة يتطلب تحديد المسارات المكونة يدويًا.

لذا، قدم فريق البحث نهجًا جديدًا يعتمد على نموذج VLM-driven، والذي يسعى لتحقيق توليد رسومات SVG بشكل تركيبي. يعتمد هذا النظام على تحليل المشاهد البصرية إلى هرمونات دلالية وهندسية عبر تفكيك من أعلى لأسفل، مع التحليل البصري واسترداد التي تم توجيهه من خلال الأوامر. هذا يضمن أن كل مكون مكتمل هندسيًا.

بالإضافة إلى ذلك، تم تقديم معيار Semantic SVG Benchmark والذي يحتوي على مجموعات دلالية مُعلمة من قبل البشر ومقاييس فرعية جديدة مثل الدقة والاستدعاء الدلالي (Semantic Recall/Precision وPERE) لتقييم التركيب الهيكلي والقدرة على التعديل بشكل دقيق.

أظهرت التجارب أن الهياكل التي يتم توقعها بشكل أصلي تتفوق على الطرق الحالية في جودة التجميع وقابلية التحرير، مع الحفاظ على وضوح بصري متفوق. هذا التقدم يمثل خطوة مهمة نحو تحسين قدرة معالجة الصور وتوليد الرسومات الذكية.