في عالم الذكاء الاصطناعي، تتزايد الطموحات لتطوير نماذج قادرة على التعامل مع مهام متعددة الأبعاد، ومن بينها معالجة المخططات. لكن رغم تحقيق نماذج اللغات الضخمة متعددة الوسائط (Multimodal Large Language Models - MLLMs) تقدمًا كبيرًا في فهم وإنتاج وتعديل المخططات، لا تزال قدرتها على إضافة تعليقات على المخططات القائمة بحاجة إلى مزيد من الاستكشاف.

يعد وضع تعليقات للمخططات مهمة ليست بالسهلة، فهي تتطلب من النماذج استنتاج الرسائل المقصودة، وتفسير معاني المخططات، وتضمين العناصر النصية أو الرسومية المناسبة. هنا يأتي دور منصة ChartAnno، التي تقدم معيارًا جديدًا لتقييم أداء MLLMs في عملية توليد التعليقات.

تتضمن منصة ChartAnno 1,200 مخطط حقيقي موزعة على ثلاثة مستويات من خصوصية التعليمات، مع تقديم التعليمات البرمجية وتعليمات التعليق. تم تقييم 10 نماذج تمثيلية تحت إعدادين أساسيين، وهما: (1) التعليمات البرمجية للمخطط فقط، و(2) التعليمات البرمجية للصورة المخطط، إضافةً إلى دراسة تجريبية تعتمد فقط على صورة المخطط.

كشفت النتائج أن النماذج المملوكة لا تزال تتفوق في الأداء الشامل، رغم أن النماذج مفتوحة المصدر الكبيرة قادرة على تقليص الفجوة. كما أظهرت النتائج أن التعليمات الأكثر تخصيصًا تحسن من جودة التعليق، بينما يبقى استنتاج النية المجردة من أكبر التحديات أمام النماذج الحالية.

بالإضافة إلى ذلك، يوضح توفير الصور الخاصة بالمخططات تحقيق مكاسب محدودة، حيث ظهرت التحسينات بشكل رئيسي في مؤشرات التصميم. تؤكد هذه النتائج على أن توليد التعليقات على المخططات تعد مهمة صعبة تتطلب استنادًا دلاليًا وتصميمًا فعالًا للتعليق. ومن المتوقع إصدار الشيفرة والبيانات في نسخة مستقبلية.

هل أنتم متحمسون لتطورات الذكاء الاصطناعي في معالجة المخططات؟ شاركونا آراءكم!