تتطور أنظمة البحث الآلي (Automated Research Systems) بسرعة لتدعم مجالات متعددة مثل تجميع الأدبيات (Literature Synthesis)، وابتكار الأفكار (Research Ideation)، وإجراء التجارب، وكتابة الأبحاث، وكذلك التقييم من قبل الأقران (Peer Review). ولكن، يظل تقييم هذه الأنظمة موزعًا عبر مهام متعددة ومعايير متنوعة، مما يجعل المقارنة المباشرة تحديًا كبيرًا.

في مراجعتنا للأدبيات المتعلقة به، رصدنا ستة مجالات تناقش الجوانب المهمة لتقييم الأنظمة: تجميع الأدبيات، ابتكار الأفكار، سلاسل العمل القابلة للتنفيذ (Executable Workflows)، الكتابة العلمية والتواصل، المراجعة الآلية من قبل الأقران، وأخيرًا، الأبحاث الشاملة من البداية للنهاية (End-to-End Research).

وعند تقييم هذه الأنظمة، قارنّا بين طرق بناء المهام، ومصادر الأدلة، والمقيمين، وإجراءات التقييم لتوضيح القدرات التي يتم تقييمها. من خلال تحليل هذه الأدبيات، استخلصنا ثلاث دروس رئيسية:
1. توفر فحوصات المخرجات وفحوصات العمليات والدراسات البشرية معلومات مكملة تعزز الفهم الشامل لتقييم الأنظمة.
2. يجب أن تتناسب معايرة المقيمين مع الخصائص التي يتم تقييمها، حيث تختلف المعايير باختلاف الخصائص.
3. تساهم الميزانيات والجهود المخصصة بشكل كبير في تفسير المقارنات المحتملة للأداء.

يتم تحديد تصميمات تقييم تشخيصية والفجوات الموثقة في الأدلة الداعمة، كما أن هذه المقارنة تُترجم إلى توصيات للتقارير والتدقيق الخاصة بعمليات التقييم. الهدف من هذه المراجعة هو تسهيل القراء في التنقل بين التقييمات الحالية واختيار المعايير المناسبة، وكذلك تصميم الدراسات المستقبلية بشكل فعال.

في نهاية المطاف، يعد فهم كيف يمكن تقييم الأنظمة الحديثة أمرًا ضروريًا لتعزيز البحث العلمي وتبسيط آلياته.