عالم التكنولوجيا الحديثة يشهد دائمًا تطورات مذهلة، وآخرها SciDocBench، وهو معيار موجه نحو تحسين فهم المستندات العلمية. بما أن الأوراق العلمية تتطلب من النماذج القدرة على تفكيك النصوص، المعادلات، الصور، الجداول، الشيفرات، والمجموعات البيانية، أصبحت الحاجة ملحة لإيجاد معايير تقيم هذه القدرات بشكل متكامل. العديد من المعايير الحالية تقيم كل قدرة على حدة، مما يترك تساؤلات حول مدى قدرة النماذج متعددة الأنماط على دعم الأعمال الحقيقية في قراءة الوثائق العلمية.

يقدم SciDocBench حلاً مبتكرًا يتضمن 124 سؤالًا تم تأليفها بواسطة خبراء في المجال، حيث تم تنظيمها في سبع مجموعات للقدرات البحثية و19 مهمة فرعية عبر خمسة مجالات علمية. وقد تم تصميم كل سؤال ضمن أربعة ظروف متطابقة، مما يجمع بين الأسئلة باللغة الإنجليزية أو الصينية مع تمثيلات الوثائق مصنفة بشكل متدرج، مما تقود إلى 496 حالة تقييم شاملة.

تكشف النتائج أن أقوى نظام تم تقييمه لا يحقق سوى 62.6 من 100، حيث أظهرت النتائج ضعفاً واضحًا في إدراك الوثائق، تثبيت الأدلة، التحقق، والتفكير عبر الوثائق. وللترجمة العملية لهذه التشخيصات إلى إشارات تدريبية قابلة للتوسع، تم تقديم SciDocIR، وهو تمثيل Graph للأدلة يُحافظ على كائنات الوثائق العلمية، تخطيطها، وعلاقات الإشارة المتبادلة.

إلى جانب SciDocIR، تم إنشاء SciDocDataset، والذي يتضمن حوالي 15,000 عينة تدريب تحت إشراف و8,000 عينة تعلم تعزيز عبر 14 مهمة فرعية قابلة للتحقق. ومن خلال دمج SciDocBench وSciDocIR وSciDocDataset، تم تشكيل إطار عمل متكامل للتقييم والتدريب، مما يسهم في اكتشاف وتحسين مساعدين الوثائق العلمية.

لمعرفة المزيد عن هذا الابتكار الرائد، تفضل بزيارة موقع المشروع.

ما هو رأيك في هذه الخطوة نحو تحسين فهم المستندات العلمية؟ شاركونا في التعليقات!