في عالم الأبحاث اليوم، تتطلب المراجعات المنهجية مستوى عميق من الحكم البشري عبر آلاف السجلات. لكن العجيب، أن التقييمات الحالية لنماذج اللغات الضخمة (Large Language Models) غالبًا ما تفحص مراحل المراجعة بشكل معزول. هنا يأتي دور SciLitBench، المعيار الجديد الذي يتميز بكونه معيارًا متعدد المراحل يشمل فحص العناوين والملخصات، وفحص النص الكامل، واستخراج البيانات الموجهة بواسطة نماذج محددة.

تم تجميع SciLitBench استنادًا إلى 42,981 سجلًا مستردًا و1,012 نصًا كاملاً و888 ورقة تم تضمينها، مما يوفر قاعدة بيانات فريدة للمستخدمين. من خلال اختبار 22 نموذجًا مفتوح الوزن من ست عائلات نماذج، تشير النتائج إلى أن تطبيق معايير شاملة بالإضافة إلى معايير استبعاد واضحة يساعد في تحسين معدل F2 لفحص العناوين والملخصات بنسبة 28.8%. وعلى صعيد آخر، فإن الاعتبارات التي وضعها الباحثون لتحليل النص الكامل تعزز الأداء بنسبة 15%.

ومع ذلك، يشير استخراج البيانات إلى نظام موثوق مختلف. فقد تراجع الأداء من دقة 0.97 لسنة النشر إلى 0.37 لتداخل جاكارد (Jaccard overlap) للطريقة الحسابية، مع استرداد أقوى النماذج لـ30% فقط من الأدلة المسجلة و25% من القيود.

بذلك، يعكس SciLitBench الحدود العملية بين عمليات الفحص ذات الاسترجاع العالي واستخراج الأدلة الكاملة، وهو مورد يمكن تكراره لتقييم تجميع الأدلة المسندة بالذكاء الاصطناعي. ما رأيكم في هذا التطور؟ شاركونا في التعليقات!