تعتبر مراجعة الأقران حجر الزاوية في ضمان جودة الأبحاث والعلوم؛ ومع ذلك، فإن التقييمات الحالية لمراجعة الأقران المدعومة بالذكاء الاصطناعي (AI-assisted peer review) تتمحور في الغالب حول جودة المراجعات المنتجة أو دقة القرارات النهائية، مما يشير إلى فجوة في الأدلة المتعلقة بدعم القرارات من خلال مراجعة موثوقة.

تسلط دراسة جديدة الضوء على الحاجة إلى وجود معايير تقييم مركزية على العملية، حيث تقدم Benchmark تشخيصية جديدة لمراجعة الأقران المدعومة بالذكاء الاصطناعي. تقوم هذه المعيار باستخدام متغيرات تمثل المحتوى والمُلخص والتعليق والاقتراح والقرار (x,$z_s$,$z_c$,$z_r$,y).

تم تحويل سجلات المراجعة المتباينة من PeerRead وNLPeer ARR-22 وOpenReview-ICLR إلى بيانات متوافقة مع العملية، ويستخدم المعيار الجديد تنبؤ القرارات المباشر من محتوى الأوراق كمقياس أساسي. كما يقارن هذا المعيار بين المتغيرات المعتمدة على العملية Gold-process والمتغيرات المتنبأ بها Predicted-process، حيث أظهر التجريب عبر ثلاث مجموعات بيانات وستة نماذج أن متغيرات Gold-process تمتلك قيمة قرار أعلى بشكل عام.

على الرغم من أن النصوص المتوسطة المولدة من النماذج تظهر توافقًا محليًا مرتفعًا عبر المراحل المتجاورة، إلا أن القرارات النهائية لا تحصل دائمًا على دعم ثابت من الأدلة السابقة. لذا، يستهدف هذا المعيار أنظمة الذكاء الاصطناعي المُصممة لتساعد المراجعين بدلًا من استبدالهم، ويقدم أداة تشخيصية شفافة وقابلة للتدقيق لتقييم موثوقية عمليات مراجعتهم.