في عالم البرمجيات العلمية، يمثل التحدي العصيب في استخدام الوكلاء الحاسوبيين عبر نماذج اللغة المرئية (Visual Language Models - VLMs) امتحاناً صعباً يتطلب فهم واجهات متخصصة، والتعامل مع كائنات علمية، وإنتاج نتائج قابلة للتحقق. لهذا السبب، تم تقديم معيار OSWorld-Science، الذي يعتبر بيئة تقييم شاملة تدمج بين مهام علمية ذات معنى ومعايير مبنية على التقييم القائم على المواد، بالإضافة إلى أداة فعالة لدراسة استخدام الحاسوب في المجال العلمي.

يتضمن المعيار 12 نموذجاً من نماذج اللغة المرئية و146 مهمة عالية الجودة عبر عدة مجالات علمية وتكوينات برمجية، تغطي تدفقات العمل مثل رسم الجزيئات، وتحليل صور الأمراض، والحوسبة الإحصائية، والمحاكاة الفيزيائية. حيث تم تطوير المهام من خلال مقترحات خبراء وتصميم مشترك بين الإنسان والذكاء الاصطناعي، مع توجيه الاختيار بناءً على القيمة العلمية والصعوبة.

تتم مراجعة المهام بواسطة مقيميين يعتمدون على تنفيذ محدد، يقومون بفحص حالات التطبيق والمواد الناتجة، بما في ذلك الهياكل الجزيئية، وأقنعة التقسيم، والرسوم البيانية، والنتائج العددية، ومنح درجات جزئية للنتائج غير المكتملة. بالإضافة إلى ذلك، يتكامل نظامنا الخاص مع محولات النماذج، والتحكم في حلقات التفاعل، وتسجيل المسارات لدعم المقارنات بين النماذج واستراتيجيات التفاعل.

تشير نتائجنا إلى أن النماذج الحالية في ذروتها، حتى مع دعمها بأداة فعالة، لا تزال تواجه تحديات في معالجة الأسئلة الرئيسية في المجالات العلمية. كما قمنا بتحليل نتائج المعيار عبر اللغات المتعددة، وجهود التفكير، وطول السياق، وعوامل أخرى، واستخرجنا استنتاجات مهمة ود Directions للمساعدة في تطوير مستقبل الأدوات العلمية.

بشكل عام، قدمنا إطاراً متكاملاً يربط الأهداف العلمية المحددة من الخبراء بالنتائج البرمجية القابلة للتحقق، مما يمكّن التقييم المنهجي لقدرات الوكلاء وتصميم الأدوات في تدفقات العمل العلمية.