في عصر تتزايد فيه أهمية الكتابة العلمية الدقيقة، يأتي مشروع Benchmark Diagram-MMU ليمثل خطوة نوعية في تقييم قدرات نماذج اللغات الضخمة (MLLMs) في مجال تحليل الرسوم البيانية العلمية. فمع تزايد الاعتماد على هذه النماذج، أصبح من الضروري توفير أدوات تقييم دقيقة تعكس مدى قدرتها على معالجة المعلومات العلمية بشكل فعال.

يتميز Benchmark Diagram-MMU بتقديمه لـ 3.7 ألف رسم بياني منسق و18.3 ألف سؤال تم التحقق من صحته من قبل البشر، عبر ستة مجالات علمية مختلفة. كما يتناول التقييم ثلاثة مهام رئيسية تتمثل في تحويل الرسوم البيانية إلى كود LaTeX، وتحرير هذا الكود، والإجابة على الأسئلة المتعلقة بالرسوم البيانية.

تشير النتائج إلى أن مهام تحويل الرسوم البيانية إلى كود تعتبر أكثر تحديًا من الإجابة على الأسئلة، مما يسلط الضوء على الحاجة لتطوير أساليب تعزز من قدرة MLLMs على توليد الكود. كذلك، أظهرت معظم النماذج تحسنًا في الأداء عند تنفيذ المهام ضمن إعدادات وكيل، إلا أنها شهدت تدهورًا في أداء الإجابة على الأسئلة، باستثناء نموذج Claude-4.6 Opus الذي سجل تحسينات ملحوظة في جميع المهام.

بإطلاق هذا المعيار، يفتح الباحثون أمامهم آفاقًا جديدة للعمل والابتكار في مجال الكتابة العلمية، مما يساعد في تعزيز جودة النتائج العلمية وتسهيل التعاون بين العلماء. هل أنتم مستعدون لاستكشاف إمكانيات هذه التكنولوجيا المتقدمة؟ شاركونا آراءكم وتجاربكم في التعليقات.