في عالم الذكاء الاصطناعي المتطور، يظهر معيار جديد يُعرف بScienceArena، والذي يُعتبر بمثابة اختبار أُولي لتقييم نماذج اللغات الضخمة (Large Language Models) في سياقات علمية معقدة. تم تصميم هذا المعيار استنادًا إلى مجموعة من مسابقات العلوم العامة في مجالات الفيزياء والكيمياء والأحياء، بما في ذلك مسابقات IPhO وIChO 2025-2026 وIBO 2023.

تُظهر الدراسات الحديثة أن تجاوز معايير التقييم التقليدية أصبح ضروريًا بسبب مشاكل مثل التشبع في المعايير ووجود بيانات مُلوثة تُؤثر على الأداء الواقعي للنماذج. ومع ScienceArena، نعتمد على مشكلات مفتوحة ذات خطوات متعددة وتقييم يعتمد على معايير دقيقة، مما يجعل عملية التقييم أكثر تحديًا.

تم تطوير ScienceArena من خلال عملية رقمية مُدققة من قبل خبراء. تتضمن هذه العملية تحويل الامتحانات الرسمية والصور والحلول إلى عناصر منظمة تم التحقق منها بواسطة فائزين بالميداليات في مسابقات العلوم. لقد أجريَت تقييمات للنماذج بناءً على الإجابات المحفوظة من خمسة نماذج مختلفة في مسابقات IPhO وIChO، مما يُظهر أن بعض النماذج تقترب من درجات خبراء التقييم.

ومع ذلك، تبين أن الفشل في بعض الحالات يعود لأسباب مثل عدم توصيل المعاني البصرية، والأمانة الهيكلية، والتحكم العالمي في المشكلات بدلاً من نقص المصطلحات العلمية. وفي نهاية المطاف، حققت النماذج الرائدة درجات تعادل الميداليات في عدة امتحانات دولية، مشيرةً إلى استمرار التحديات في مجالات الكيمياء والتسلسل الزمني الطويل.

للتجربة أكثر، يمكنكم زيارة العرض التفاعلي المتاح على الموقع الرسمي لScienceArena.