أعلنت مجموعة من الباحثين عن إطلاق معيار Chart2Code، الذي يمثل خطوة متقدمة في اختبار قدرات النماذج الكبيرة متعددة الوسائط (LMMs) في فهم الرسوم البيانية وتوليد الشيفرات. تم تصميم هذا المعيار بنهج يركز على المستخدم، حيث يهدف إلى التقاط مجموعة متنوعة من السيناريوهات الواقعية ورفع مستوى صعوبة المهام بشكل تدريجي.

يتألف Chart2Code من ثلاثة مستويات متميزة:
1. **مستوى 1 (إعادة إنتاج الرسوم البيانية)**: حيث يقوم النموذج بإعادة رسم الرسوم البيانية استنادًا إلى شكل مرجعي واستفسار المستخدم.
2. **مستوى 2 (تحرير الرسوم البيانية)**: يتضمن تعديلات معقدة مثل تغيير أنواع الرسوم أو إضافة عناصر جديدة.
3. **مستوى 3 (تحويل الجداول الطويلة إلى رسوم بيانية)**: يقوم فيها النماذج بتحويل الجداول الغنية بالمعلومات إلى رسوم بيانية دقيقة تتماشى مع تعليمات المستخدم.

يُعتبر هذا المعيار الأول من نوعه الذي يعكس الاستخدام العملي لتقنية chart2code مع تحجيم منهجي لتحديات المهام. يحتوي Chart2Code على 2023 مهمة تغطي 22 نوعًا من الرسوم البيانية، مع معايير تقييم متعددة المستويات تقيم كل من دقة الشيفرة وجودة الرسوم المُعَدّة.

لقد تم اختبار 25 نموذجًا رائدًا في هذا المجال، بما فيها النماذج المفتوحة المصدر مثل GPT-5 وQwen2.5-VL، حيث أظهرت النتائج التجريبية أن حتى النموذج الأكثر تطورًا، GPT-5، يحقق متوسط درجة 0.57 فقط في تقييم الشيفات و0.22 في تقييم جودة الرسوم عبر مهام التحرير، مما يبرز صعوبة معيار Chart2Code.

نتطلع إلى أن يسهم هذا المعيار في تعزيز مهارات التفكير متعدد الوسائط والدفع نحو تطوير نماذج LMMs أكثر قوة وفاعلية. الرمز والبيانات متاحة الآن على Chart2Code.