في خطوة ثورية نحو تحسين تقييم نماذج الذكاء الاصطناعي، أعلن باحثون عن تصحيح عيوب جذرية في معيار SciCode، والذي يُعتبر المقياس القياسي لقدرة هذه النماذج على البرمجة العلمية. يُستخدم SciCode لتقييم كيف يمكن لنماذج الذكاء الاصطناعي توليد كود علمي يتماشى مع مشاكل بحثية معقدة تتطلب فهمًا عميقًا من النظريات العلمية الحديثة.

مؤخراً، لاحظ الباحثون أن درجات النماذج، خصوصاً تلك التي حققت تقدمًا ملحوظًا في 2026، قد استقرت عند حوالي 60% من دقة الحلول الفرعية، حيث ارتبطت هذه الثغرات بنقص في دقة المعيار نفسه. بعد مراجعة شاملة لما يقارب 65 مشكلة، توصل العلماء إلى 263 عيبًا، حيث أثبت 192 منها أنها تؤدي إلى رفض التعليمات الصحيحة عن غير وجه حق.

المفاجأة كانت أن 78% من هذه العيوب تتطلب معرفة متخصصة في الفيزياء أو الرياضيات لاكتشافها، وليس مجرد مراجعة إدارية بسيطة. ومن خلال تصحيح هذه العيوب، تم إطلاق "SciCode-Verified"، حيث أُعيدت تقييم دقة 12 نموذجًا رائدًا وتم تسجيل تحسن ملحوظ في الأداء.

نتائج التصحيح أظهرت أن دقة الحلول الفرعية ارتفعت من 45-60% إلى 84-98%، بينما ارتفعت دقة الحلول الأساسية من 9-27% إلى 69-92%. هذا التحسن الكبير يثبت أن النماذج الحديثة كانت أكثر كفاءة في البرمجة العلمية مما أوضحته معايير SciCode السابقة، مشيرًا إلى أن العائق لم يكن في قدرات النماذج، بل في جودة أداة التقييم.

لقد تم إصدار SciCode-Verified كمعيار جديد تصحيحي مع سجل تدقيق كامل، مما يعزز فائدة هذه النماذج في المستقبل ويعطي الباحثين أدوات أفضل للعمل.

هل تعتقد أن هذه التحديثات ستحدث تحولًا حقيقيًا في قدرات الذكاء الاصطناعي في مجالات العلوم؟ شاركونا آراءكم في التعليقات.