في عالم يتزايد فيه الاعتماد على التكنولوجيا لتحسين دقة التعرف على النصوص والوثائق، يأتي SP-DocReader كخطوة متقدمة نحو تحقيق تحسن ملموس في دقة التعرف على الأحرف بصريًا (OCR). نشرت دراسة حديثة على موقع arXiv توضح كيف تمكن هذا الإطار من تقليل الأخطاء المتبقية بعد مرحلة التدريب بإستراتيجية مبتكرة تعتمد على ما يُعرف بلعبة الذات (Self-Play).

تعتمد هذه التقنية على استخدام ماسك تطابق الفروقات (Reading Discrepancy Masking) من أجل محاذاة الرموز المرجعية والرموز الناتجة عن النموذج من خلال أطول تسلسلات مشتركة. تساعد هذه المنهجية أيضًا في تقييم المواقع غير المتطابقة باستخدام تفضيلات الشروط الكاملة. ومن خلال استخدام خسارة النزاهة المركزة (Focused Fidelity Loss)، استطاع الباحثون تقديم إشراف مباشر للحد من احتمال الخطأ في المواقع الحقيقية غير المتطابقة.

الأكثر إثارة هو أن الوحدة المعنية بالتعرف على الأحرف (OCR Module) هي الوحيدة التي يتم تدربيها، مما يضمن تجهيز دقيق للنموذج مع الإبقاء على الجزء الأساسي مجمدًا. وتشير نتائج الاختبارات إلى أن SP-DocReader قد تمكن من تقليل معدل خطأ الأحرف Vary-600K بنسبة كبيرة، مع تقليل الخطأ بنحو 54% مقارنة بنموذج SFT-2. الأهم من ذلك، أنه عزز أيضًا معدل تشابه ليفنشتاين المُعدل (ANLS) بمقدار 3.7 نقطة على نموذج Qwen3-VL-4B.

تُظهر هذه النتائج القيمة الكبيرة لتركيز التدريب باللعبة الذاتية على الاختلافات المتبقية بعد التدريب التقليدي، مما يفتح آفاق جديدة لتحسين دقة إدخال البيانات من المستندات.