في عالم اليوم الرقمي حيث تتزايد كمية الوثائق بشكل مستمر، بات من الضروري تطوير طرق فعالة لتحليل هذه الوثائق وتحويلها إلى صيغ يسهل قراءتها بواسطة الآلات. وقد شهدنا مؤخرًا تقدمًا بارزًا في نماذج الرؤية اللغوية (Vision-Language Models) مما ساهم في تحسين هذه العملية، إلا أن هناك تحديين رئيسيين لا يزالان يؤثران على هذا المجال.
التحدي الأول يتعلق بالاعتماد المفرط على تحليل التخطيط الدقيق، حيث أن أي تشوهات جغرافية في الوثائق التي يتم التقاطها بالكاميرا يمكن أن تؤدي إلى أخطاء متتالية. أما التحدي الثاني، فيتعلق بالأساليب التي تعتمد على نماذج VLM الشاملة، حيث تعاني هذه الطرق في كثير من الأحيان من الإنتاج غير الضروري والأخطاء الزائفة، بالإضافة إلى قلة القدرة على التفكير الهيكلي في السيناريوهات عالية الدقة.
لتجاوز هذه التحديات، تم طرح نظام NaviDC-OCR، الذي يمثل إطارًا موحدًا لتحليل الوثائق. يقدم هذا النظام تقنية التعلم الحساس للتشوهات، مما يسمح بنقل الوعي الهندسي إلى نماذج VLM. كما يطرح آلية أخذ عينات تكيفية لتمثيل التخطيطات المعقدة بشكل أفضل. علاوة على ذلك، تم تطوير استراتيجية تعلم مفصولة للمحتوى والهياكل، مما يمكّن النظام من تمثيل الصيغ النحوية والهياكل الجدولية بشكل أكثر فعالية.
أظهرت تجارب شاملة أن نظام NaviDC-OCR يحقق أداءً رائدًا في مختلف مؤشرات تحليل الوثائق، حيث حصل على نتائج مذهلة بلغت 96.87 و88.53 و78.41 في OmniDocBench v1.6 وWild-OmniDocBench وPureDocBench على التوالي، مما يجعله يتصدر قائمة تحدي Sci-ImageMiner في ICDAR 2026. هذه النتائج توضح فعالية وقدرة النظام على التعميم في السيناريوهات المعقدة لتحليل الوثائق.
نظام NaviDC-OCR: ثورة في تحليل الوثائق الرقمية والتقاط الصور!
يقدم نظام NaviDC-OCR إطارًا موحدًا يعدّ ثورة في مجال تحليل الوثائق، حيث يدمج التعلم الحساس للتشوهات مع طرق مبتكرة لتدريب الهياكل. النتائج تشير إلى أداء مذهل في التحديات المتعلقة بالوثائق المعقدة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
