في عصر المعلومات، تكتسب إحصاءات ملفات PDF على الويب أهمية بالغ، خاصةً في ظل الزيادة السريعة في المحتوى. ولكن هل تعلم أن هناك حواجز واضحة في الطريقة التي تُحتسب بها هذه الإحصائيات؟
بحسب دراسة حديثة نُشرت على منصة arXiv، تتمثل المشكلة في "انحياز الوحدات"، حيث يتم الإبلاغ عن الحجم من حيث عدد الرموز (tokens)، في حين أن جميع المعدلات الأخرى التي تنشرها هذه الكوربورات تُحسب وفقًا لعدد الوثائق. لكن كلا الوحدتين تختلفان بشدة.
على سبيل المثال، في مجموعة بيانات CC-MAIN-2021-31-PDF-UNTRUNCATED التي تضم حوالي 7.9 مليون ملف PDF، و33.6 مليار رمز، يتبين أن 3.02% فقط من الوثائق النصية تحمل نصف الرموز. وفي حين تمثل الوثائق التي تتجاوز 50 صفحة 5.00% من المجموعة، إلا أنها تحتوي على 53.53% من النصوص.
تظهر الدراسة أيضاً أن الوثائق الناتجة عن أدوات TeX{} تشكل فقط 1.66% من العدد الإجمالي لكن تسهم في 4.05% من النصوص. هذه الإحصائيات تجعلنا نتساءل، ما الذي يحدث للوثائق المتأثرة بالحدود التقديرية؟ يُظهر البحث أن 23.06% من الوثائق تأثرت بحد التقطيع، مما أدى إلى فقدان 63.08% من النصوص.
لا يتمثل الحل فقط في تحسين تقنيات استخراج النصوص، بل ينصح الخبراء بإبلاغ الإحصائيات باستخدام كلتا الوحدتين: الوثائق والرموز، لضمان تقديم صورة أوضح ودقيقة للمستخدمين.
هل تعتقد أن هذه التوصيات ستعمل على تحسين الشفافية في عرض إحصائيات ملفات PDF؟ شاركونا آراءكم في التعليقات!
هل تحصي الوثائق فعلاً النصوص؟ كشف النقاب عن انحياز الوحدات في إحصاءات ملفات PDF على الويب
تكشف الدراسات الحديثة عن وجود انحياز في حسابات إحصائيات ملفات PDF على الويب، حيث يُظهر تحليل البيانات أن نسبة كبيرة من النصوص تتعلق بعدد محدود من الوثائق. هل حان الوقت لتغيير طريقة تقديم هذه الإحصائيات؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
