في خطوة ثورية نحو تحسين تقييم نماذج الذكاء الاصطناعي، أعلن باحثون عن تصحيح عيوب جذرية في معيار SciCode، والذي يُعتبر المقياس القياسي لقدرة هذه النماذج على البرمجة العلمية. يُستخدم SciCode لتقييم كيف يمكن لنماذج الذكاء الاصطناعي توليد كود علمي يتماشى مع مشاكل بحثية معقدة تتطلب فهمًا عميقًا من النظريات العلمية الحديثة.
مؤخراً، لاحظ الباحثون أن درجات النماذج، خصوصاً تلك التي حققت تقدمًا ملحوظًا في 2026، قد استقرت عند حوالي 60% من دقة الحلول الفرعية، حيث ارتبطت هذه الثغرات بنقص في دقة المعيار نفسه. بعد مراجعة شاملة لما يقارب 65 مشكلة، توصل العلماء إلى 263 عيبًا، حيث أثبت 192 منها أنها تؤدي إلى رفض التعليمات الصحيحة عن غير وجه حق.
المفاجأة كانت أن 78% من هذه العيوب تتطلب معرفة متخصصة في الفيزياء أو الرياضيات لاكتشافها، وليس مجرد مراجعة إدارية بسيطة. ومن خلال تصحيح هذه العيوب، تم إطلاق "SciCode-Verified"، حيث أُعيدت تقييم دقة 12 نموذجًا رائدًا وتم تسجيل تحسن ملحوظ في الأداء.
نتائج التصحيح أظهرت أن دقة الحلول الفرعية ارتفعت من 45-60% إلى 84-98%، بينما ارتفعت دقة الحلول الأساسية من 9-27% إلى 69-92%. هذا التحسن الكبير يثبت أن النماذج الحديثة كانت أكثر كفاءة في البرمجة العلمية مما أوضحته معايير SciCode السابقة، مشيرًا إلى أن العائق لم يكن في قدرات النماذج، بل في جودة أداة التقييم.
لقد تم إصدار SciCode-Verified كمعيار جديد تصحيحي مع سجل تدقيق كامل، مما يعزز فائدة هذه النماذج في المستقبل ويعطي الباحثين أدوات أفضل للعمل.
هل تعتقد أن هذه التحديثات ستحدث تحولًا حقيقيًا في قدرات الذكاء الاصطناعي في مجالات العلوم؟ شاركونا آراءكم في التعليقات.
ثورة في تقييم نماذج الذكاء الاصطناعي: اكتشافات SciCode تُحدث نقلة نوعية في قدرة البرمجة العلمية!
تمكن باحثون من تحسين تقييم نماذج الذكاء الاصطناعي في البرمجة العلمية من خلال تصحيح عيوب في معيار SciCode. النتائج الجديدة تكشف عن تحسن ملحوظ في دقة النماذج، مما يفتح آفاقاً جديدة في هذا المجال.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
