أطلق فريق VectifyAI الإصدار الجديد من MMLongBench-Doc، وهو معيار أسئلة (QA Benchmark) مخصص لاختبار الوثائق الطويلة. يتضمن هذا الإصدار تحديثات هامة على ما يزيد عن 1,000 سؤال، موزعة على 134 وثيقة PDF.

يتمثل أحد أبرز التحديات في الإصدار السابق في مقارنة الإجابات المستخرجة بالمرجع، مما أدى إلى تقلبات في النتائج حيث أن بعض الإجابات كانت خاطئة أو غير دقيقة. أما في الإصدار MMLongBench-Doc-V2، فقد تم تصحيح 106 من هذه التعليقات، مع تقديم تفاصيل دقيقة تشمل الصفحة والمنهجية المستخدمة لتسويغ هذه التعديلات.

هذا الإصدار الجديد يعزز الفحص باستخدام نموذج لغوي كبير (Large Language Model) لتحديد ما إذا كانت الإجابة تعبر عن المرجع بشكل صحيح. ولتجنب الأخطاء السابقة، تم حذف عشرة أسئلة كانت وثائقها تحمل أسماء ملفات خاطئة، ما ساهم في رفع عدد الأسئلة إلى 1,071 مع تقليل الأخطاء.

الأهم من ذلك، تقدم MMLongBench-Doc-V2 إجراء لتوسيع مجموعة المفاتيح الفارغة بطريقة محكمة، مما يتيح تحسين التقييم دون التأثير على البيانات السلبية المتعمدة.

تجدر الإشارة إلى أن النتائج الجديدة لا تقارن بالأرقام التي تم نشرها في الإصدار السابق. للإطلاع على مجموعة البيانات المصححة وسجل التصحيح لكل مدخلة، يمكن زيارة GitHub.

ما رأيكم في هذه التطورات الجديدة في مجال تقييم الوثائق الطويلة؟ شاركونا آراءكم في التعليقات.