في عالم الأبحاث العلمية، تتطلب مراجعات الأدب الجودة والدقة لضمان تقدم فعال في المعرفة. ومع ذلك، يبقى تقييم هذه المراجعات، وخاصة التي يتم إنشاؤها تلقائيًا، تحديًا كبيرًا. لهذا السبب، تم تقديم منصة LitReview Arena، وهي الأولى من نوعها، تعتمد أسلوب المواجهة لتقييم مراجعات الأدب.

تُشرف هذه المنصة على عملية تقييم دقيقة حيث يتم تجميع خبراء في مجالات معينة وصناديقهم لمقارنة مسودات مراجعات الأدب بشكلanonymous. يُطابق الخبراء مع المواضيع داخل مجالات خبرتهم ويقومون بتقييم المسودات وفق خمسة معايير محددة. من خلال هذا النظام، تم جمع حوالي 3000 حكماً من الخبراء، كل واحد منها يحتوي على نتائج دقيقة بالشروط المحددة.

اللافت للنظر، أن النتائج أظهرت أن الأنظمة الحالية لا تتفوق سوى في 23.0% من الجولات الحاسمة ضد المسودات البشرية. في المقابل، تُظهر نماذج اللغة الكبيرة (LLMs) مثل Sonar Deep Research أداءً أفضل بشكل واضح حيث تتفوق على الأنظمة الأساسية بنسبة تفوق 60%.

ومع ذلك، لا تخلو الأمور من تحديات، إذ تُظهر الدراسات عجز أنظمة القضاة المعتمدة على نماذج اللغة في المحاذاة بشكل فعّال مع تقييمات الخبراء، خاصة عندما يتعلق الأمر بمعايير تعتمد على عقلانية الربط والأفكار.

لذا، من أجل تحسين التنسيق، تم تطوير LitJudge، وهو مقياس تم معايرته من قبل الخبراء، ليحقق تحسنًا ملحوظًا في التنسيق، بما يقارب تطابق الخبراء المتخصصين.

لمن يرغب في استكشاف الكود والبيانات، فهي متاحة عبر GitHub، مما يُظهر التزام الباحثين بشفافية المعرفة في هذا المجال المبتكر.