شهد مجال النشر العلمي نموًا متسارعًا، مما أثر بشكل كبير على عملية التحكيم، وخاصة في مجال التعلم الآلي. هذا النمو أدى إلى زيادة القلق من تدهور جودة المراجعة وازدياد الأعباء على المحكمين. وفي هذا السياق، تم اقتراح نماذج اللغات الضخمة (Large Language Models) كمساعدين آليين في عملية المراجعة، إلا أن تقييم هذه النماذج ركز بشكل كبير على تقليد المراجعات التي يكتبها البشر بدلًا من دعم الوظائف الأساسية لعملية التحكيم.

في هذه الدراسة الجديدة، نقدم منظورًا موجهًا نحو عملية التحقق من الأخطاء في مراجعة الأقران المعتمدة على نماذج اللغات الضخمة، مع التركيز على اكتشاف الأخطاء كوظيفة حاسمة ومكثّفة من حيث الموارد. كما قمنا بتطوير مقياس قابل للتوسع يقيم قدرة أنظمة المراجعة على تحديد التناقضات المنطقية، وقد تم بناء هذا المقياس من خلال إدخال أخطاء مصطنعة في أوراق المؤتمرات، مما يتيح أهداف تقييم واضحة ويسهل المقارنة المنهجية بين الأنظمة.

علاوة على ذلك، نقترح إطار مراجعة متعدد الطبقات (Multi-Layered Review) الذي يعزز فهم المخطوطة بشكل تفصيلي قبل توليد المراجعة، مما يتماشى بشكل أكبر مع ممارسات المراجعة البشرية في حين يحسن من كفاءة الاستخدام التلقائي للكلمات. أظهر نهجنا في التقييم توافقًا قويًا مع درجات مراجعة البشر، بالإضافة إلى تحقيق أداء عالي في اكتشاف الأخطاء.

تُعزى هذه التحسينات إلى كل من اختيار نموذج اللغة الضخم المستخدم وتصميم نظامنا. ومع ذلك، نؤكد على وجود ثغرات مستمرة تعرض الأنظمة الآلية للتلاعب العدائي، مما يعكس الحاجة إلى تعزيز القوة والمتانة في أنظمة المراجعة الآلية. تُبرز نتائجنا أهمية التقييم الدقيق والمركز على الأخطاء، من أجل توجيه نشر أدوات تعتمد على نماذج اللغات الضخمة بمسؤولية في عملية المراجعة وغيرها من سير العمل العلمي الحاسمة.