تتزايد أهمية توليد الرسوميات باستخدام تنسيق SVG (رسوميات متجهية القابلية للتوسع) مع تقدم نماذج الذكاء الاصطناعي في التعبير والتحكم، ولكن العملية تواجه تحديات جسيمة بسبب نقص بروتوكولات تقييم خاصة بالمجال. تعتمد الممارسات الحالية على مقاييس اقتراضية مثل CLIPScore، التي لم تتدرب أبدًا على الرسومات المتجهية، وبالتالي لا تعكس تمامًا تقييم البشر.

في هذه السلسلة الجديدة، نقدم إطارًا جديدًا للتقييم البشري لتوليد SVG يسمى extbf{SVG-Score}. هذا الإطار يستخدم تحولات التحكم في العناوين والصور لتحديد كيفية استجابة المقاييس الحالية لأخطاء مولدات SVG مثل الألوان الخاطئة، وأعداد العناصر، والعلاقات المكانية. وبفضل هذا التحليل، تبين أن مقاييس CLIP ليست فعالة بالشكل المتوقع بسبب عدم حساسيتها للمشكلات الأساسية.

نقدم أيضًا مجموعة بيانات تم تصنيفها بشريًا لقياس extit{التوافق الدلالي}، التي تقيس مدى وفاء الرسوميات المتولدة للعنوان المعبّر عنها. استنادًا إلى هذه البيانات، قمنا بتطوير مقيمين مكملين، أحدهما يعتمد على مقاييس CLIP المعدلة لتناسب الرسوميات المتجهية، والثاني هو نموذج VLM (نموذج اللغة-الرؤية) تم تدريبه من خلال التعلم المعزز لتعزيز دقة التقييم.

باستخدام هذين المقيمين، قمنا بإجراء تقييم شامل لمولدي SVG المعروفة والمفتوحة المصدر، مما يسهل فهم جيد لجودة النماذج المختلفة.