في خطوة رائدة نحو تعزيز قدرات الذكاء الاصطناعي، تم الإعلان عن مشروع OpenProblemBench، الذي يسعى لتقييم تقدم الذكاء الاصطناعي في معالجة المشكلات العلمية غير المحلولة. يواجه الذكاء الاصطناعي تحديات تتجاوز المعرفة الراسخة، حيث تتطلب هذه المرحلة القادمة من الذكاء الاصطناعي العام (Artificial General Intelligence) المعايير الجديدة التي تقيس فعاليته.

يتميز OpenProblemBench بمجموعة من 82 مشكلة لم تحل مستمدة من الأدبيات الرياضية والفيزيائية النظرية، حيث يوفر كل مشكلة السياق البحثي والافتراضات والتقدم السابق اللازم للاستكشاف. تم اختيار هذه المشكلات بعناية لضمان أن الحلول المقدمة يمكن التحقق منها بوضوح من حيث ادعاءاتها الرياضية أو الحاسوبية.

تم تقييم الحلول من قبل أربعة نماذج مستقلة تقيم مدى صحة واكتمال وتقدم كل اقتراح دون الاعتماد على حلول مرجعية. من بين سبع تكوينات تم تقييمها، حقق نموذج GPT-6-Astra أعلى معدل نجاح بمتوسط 14.0%، مقارنة بـ 5.5-6.7% للنماذج المفتوحة المتكاملة و2.4-3.7% لنماذج Flash.

تشير التحليلات إلى أن نتائج أقوى ترتبط بتغييرات في تمثيل المشكلة، والحجج العامة التي تتجاوز الأدلة المحدودة، وإثبات الخطوات اللازمة لإكمال الحل. من خلال التقييم القائم على الأسئلة المستمدة من الأدبيات البحثية، يقدم OpenProblemBench إطارًا لاستكشاف قدرات الذكاء الاصطناعي وحدوده كمساهم في العلوم النظرية الأساسية.

ما رأيكم في هذه المبادرة؟ هل تعتقدون أنها ستحدث فارقاً في التقدم العلمي؟ شاركونا في التعليقات.