في خطوة مبتكرة تهدف إلى تسريع الاكتشافات العلمية، تم تطوير أنظمة العلماء الاصطناعيين (AI Scientist) التي تتمتع بالقدرة على إجراء الأبحاث بشكل مستقل. وعلى الرغم من تلك القدرة، يبقى كيفية تقييم ومقارنة جودة الأوراق العلمية التي ينتجها الذكاء الاصطناعي تحدياً قائماً.
للإجابة على هذا السؤال، تم اقتراح وتنفيذ بروتوكول تقييم دقيق يعتمد على نظام مراجعة الأقران (Peer-Review) الأوتوماتيكي الذي يستفيد من نماذج لغوية ضخمة (Large Language Models) على مستوى متقدم. هذه النماذج تقوم بتقييم الأوراق العلمية وفقاً لأربع معايير رئيسية: الأصالة، الدقة العلمية، الوضوح، والأهمية.
شملت الدراسة أربعة أطُر رئيسية من أنظمة العلماء الاصطناعيين، وهي: "Sakana AI" (الإصدارات 1 و 2)، "CycleResearcher"، و"Data-to-Paper". وقد تم تشغيل كل إطار عمل على مجموعة متناسقة من 15 مقترح بحثي تم نشرها بواسطة شركة مستقلة متخصصة في هذا المجال، وهي "FARS"، مما أسفر عن توليد 60 ورقة بحثية قمنا بتقييمها جنباً إلى جنب مع 15 ورقة معيارية من "FARS".
اُستخدم ثلاثة مراجعين مستقلين من نماذج اللغة الكبيرة، وهي "GPT-5.4"، "Gemini"، و"Claude". وقد أظهرت النتائج أن الأوراق المرجعية من "FARS" تتفوق بشكل كبير على جميع الأطر المنافسة، محققة متوسط درجات بين 2.14 و2.47 على مقياس من 1 إلى 5، مقارنةً بـ 1.00 إلى 1.87 للأطر الأخرى.
من المثير للاهتمام أن درجات "FARS" كانت أكثر من ضعف درجات الأنظمة الثانية الأفضل على تقييمات "Gemini" و"Claude". كما أظهرت الدراسة توافقاً قوياً بين "Gemini" و"Claude"، مما يضيف مصداقية لنتائج التقييم الأوتوماتيكي. ومع ذلك، كان توافق "GPT-5.4" أضعف مما يشير إلى أنه يستخدم معايير مختلفة لتقييم الأوراق.
تُعد هذه النتائج بمثابة أول معيار كمي متاح لطريقة تقييم أنظمة العلماء الاصطناعيين، مما يوضح أن تقييم متعدد النماذج لنماذج اللغوية الضخمة يوفر إطار عمل قابل للتوسع وثابت لتقييم جودة الأبحاث الذاتية.
هل يمكن للذكاء الاصطناعي تقييم علماء الذكاء الاصطناعي؟ دراسة بنائية مبتكرة لتقييم أنظمة البحث الذاتي
تعتبر أنظمة العلماء الاصطناعيين قادرة على تسريع الاكتشافات العلمية بشكل كبير، ولكن تقييم جودة الأوراق العلمية التي يولدها الذكاء الاصطناعي يشكل تحدياً كبيراً. تتناول دراسة جديدة الأساليب الفعالة لتقييم هذه الأنظمة باستخدام نماذج لغوية متقدمة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
