في عالم يتزايد فيه الاعتماد على تقنيات الذكاء الاصطناعي (AI)، يُعتبر الفهم الدقيق للنصوص المكتوبة بخط اليد أحد أكبر التحديات التي تواجه النماذج اللغوية الكبيرة (Large Language Models). بينما نجحت نماذج مثل OmniDocBench في تحقيق دقة تبلغ 96.34% في معالجة الوثائق المطبوعة، فإن التعامل مع المستندات المكتوبة بخط اليد لا يزال يمثل عقبة كبيرة.

توجهت مجموعة من الباحثين لإنشاء معيار جديد يُدعى WildHandBench، يهدف إلى تقييم قدرات الآلات في فهم النصوص المكتوبة بخط اليد تحت ظروف متنوعة. يحتوي هذا المعيار على 500 وثيقة مكتوبة بخط اليد تغطي ثلاثة أنواع من البنية (نص حر، جداول، وصيغ)، بأربعة لغات ودراسة تسع حالات واقعية.

بالإضافة إلى ذلك، قاموا بتقديم مقياس جديد يُعرف باسم مقياس الخطأ المدفوع بالمعلومات الأولية (Prior-Driven Error - PDE)، الذي يحدد ما إذا كانت الأخطاء ناتجة عن معلومات أولية لغوية وليست عن الأدلة البصرية.

عند تقييم 18 نموذجًا من النماذج الرائدة في هذا المجال إلى جانب معايير بشرية دقيقة، كانت النتائج مثيرة للاهتمام: 1) أفضل نموذج حقق دقة قدرها 71.85% فقط؛ 2) تفوق البشر على جميع النماذج بفضل أداء جاء بنسبة 77.09%، لكن الفجوة كانت ضيقة؛ 3) كانت أخطاء النماذج تختلف نوعيًا عن أخطاء البشر — حيث أن 63-91% من أخطاء النماذج كانت ناتجة عن الاعتماد على معلومات أولية، بينما كانت النسبة للبشر 49% فقط.

تشير هذه النتائج إلى حاجة ملحة لفهم الأخطاء التي ترتكبها النماذج وتطوير التقنيات اللازمة لتجاوز هذه التحديات. إن WildHandBench ليس فقط معيارًا جديدًا، بل هو دعوة للتفكير في كيفية استجابة الذكاء الاصطناعي للواقع المعيش!