تبدو اللغة الفارسية، التي يتحدث بها أكثر من 110 مليون شخص في عدة دول، أقل تطورًا في مجال التعرف الضوئي على الحروف (Optical Character Recognition - OCR) مقارنةً باللغات ذات الكتابة اللاتينية. يكمن السبب في ذلك في تعقيد نظام الكتابة الفارسي العربي وندرة مجموعات البيانات الموسعة والمجهزة بشكل جيد. تتميز الكتابة الفارسية باتصال حروفها، وتشكيلها الجغرافي، والتنوع الأسلوبي الذي يتفق مع أشكال الكتابة المختلفة مثل النسخ (Naskh) والنستعليق (Nastaliq)، مما يجعل عملية التعرف على النصوص أكثر تعقيدًا.
في ورقتنا البحثية، نقدم مجموعة بيانات بيكسل الفارسية، وهي مجموعة بيانات متكاملة تهدف إلى معالجة هذه التحديات. تضم المجموعة أكثر من 343,000 زوج نصوص مصورة عالية الدقة، مستخلصة من مجموعة نصوص فارسية تضم سبعة ملايين كلمة، وقد تم إنشاؤها باستخدام إطار عمل SynthOCR-Gen. يتميز هذا النظام بقدرته على تقليد الخصائص الطباعة للخط الفارسي، مثل الربط السياقي بين الحروف والمواقع المتنوعة ونماذج الكتابة الفارسية.
لتعزيز الفجوة بين المجال الاصطناعي والواقعي، تم تحسين الصور الناتجة باستخدام أكثر من خمسة وعشرين نموذجًا عشوائيًا لمحاكاة عيوب الحصول على الوثائق، مثل تآكل الحبر، وشيخوخة الورق، وضبابية الصورة، وتفاوت الإضاءة، والعيوب الناتجة عن الماسحات، مما يجعلها قريبة من الواقع بشكل كبير.
بفضل مجموعة بيانات بيكسل الفارسية، يمكن للمطورين والباحثين تدريب وتطوير الأنظمة الحديثة للتعرف على النصوص مثل نماذج المحولات (transformers) كـ TrOCR وDonut، مما يفتح الأبواب أمام الأبحاث في تحليل الوثائق الفارسية، ورقمنة المخطوطات التاريخية، وفهم الوثائق من طرف إلى طرف. هذا الابتكار يمثل خيارًا عمليًا وفعالًا من حيث التكلفة لتجاوز نقص البيانات المعلنة في الخطوط الطباعة المعقدة.
بيكسل الفارسية: مجموعة بيانات متكاملة لتسهيل التعرف الضوئي على الحروف للصوت الفارسي
تقدم مجموعة بيانات بيكسل الفارسية حلاً مبتكرًا لتحديات التعرف الضوئي على الحروف (OCR) في اللغة الفارسية، مع توفير أكثر من 343,000 صورة نصية عالية الدقة. هذه المجموعة تمثل نقطة تحول في تطور تقنيات التعرف على النصوص غير اللاتينية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
