في عالم الأبحاث العلمية، تتطلب مراجعات الأدب الجودة والدقة لضمان تقدم فعال في المعرفة. ومع ذلك، يبقى تقييم هذه المراجعات، وخاصة التي يتم إنشاؤها تلقائيًا، تحديًا كبيرًا. لهذا السبب، تم تقديم منصة LitReview Arena، وهي الأولى من نوعها، تعتمد أسلوب المواجهة لتقييم مراجعات الأدب.
تُشرف هذه المنصة على عملية تقييم دقيقة حيث يتم تجميع خبراء في مجالات معينة وصناديقهم لمقارنة مسودات مراجعات الأدب بشكلanonymous. يُطابق الخبراء مع المواضيع داخل مجالات خبرتهم ويقومون بتقييم المسودات وفق خمسة معايير محددة. من خلال هذا النظام، تم جمع حوالي 3000 حكماً من الخبراء، كل واحد منها يحتوي على نتائج دقيقة بالشروط المحددة.
اللافت للنظر، أن النتائج أظهرت أن الأنظمة الحالية لا تتفوق سوى في 23.0% من الجولات الحاسمة ضد المسودات البشرية. في المقابل، تُظهر نماذج اللغة الكبيرة (LLMs) مثل Sonar Deep Research أداءً أفضل بشكل واضح حيث تتفوق على الأنظمة الأساسية بنسبة تفوق 60%.
ومع ذلك، لا تخلو الأمور من تحديات، إذ تُظهر الدراسات عجز أنظمة القضاة المعتمدة على نماذج اللغة في المحاذاة بشكل فعّال مع تقييمات الخبراء، خاصة عندما يتعلق الأمر بمعايير تعتمد على عقلانية الربط والأفكار.
لذا، من أجل تحسين التنسيق، تم تطوير LitJudge، وهو مقياس تم معايرته من قبل الخبراء، ليحقق تحسنًا ملحوظًا في التنسيق، بما يقارب تطابق الخبراء المتخصصين.
لمن يرغب في استكشاف الكود والبيانات، فهي متاحة عبر GitHub، مما يُظهر التزام الباحثين بشفافية المعرفة في هذا المجال المبتكر.
منظومة LitReview Arena: تقييم مبدع لمراجعات الأدب بأسلوب المواجهة
تقدم LitReview Arena منصة تقييم مبتكرة لمراجعات الأدب العلمي، حيث يقوم خبراء في مجالاتهم بمقارنة مسودات مراجعات الأدب بشكل متبادل. ورغم قوة الأنظمة الحالية، فإنها ليست قادرة على التفوق بشكل كامل على الأبحاث الإنسانية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
