في زمن يتزايد فيه الاعتماد على تقنيات الذكاء الاصطناعي، نعيش تحولاً مثيرًا في مجال معالجة الوثائق وفهمها. في دراسة جديدة نشرت في arXiv، يتم تسليط الضوء على نماذج رؤية-لغة (Vision-Language Models) خفيفة الوزن، والمتاحة مفتوحة المصدر، كحل بديل للنماذج المغلقة المكلفة التي قد تكون غير مناسبة للأرشفة المؤسسية. يعاني العديد من الأرشيفات من قيود تتعلق بالاستقلالية في البيانات، وأوجه القلق البيئي، فضلاً عن التكاليف المتكررة المرتبطة باستخدام واجهات برمجة التطبيقات التجارية.

تتجلى أهمية هذه الدراسة في تقديم تحليل مقارن لثمانية من هذه النماذج المفتوحة، والتي تحتوي على ما يصل إلى 7 مليار معلمة. حيث تم اختبار هذه النماذج في سياق استخراج النصوص من الصور وتحويلها إلى هيكل بيانات JSON المتوافق مع المخططات، مما يسهم في تسهيل التحقق الآلي والاستخدام اللاحق. وُضعت هذه النماذج تحت بروتوكول واعٍ للقيود، وتم قياس جودة الاستخراج وفاعلية المخرجات الهيكلية باستخدام عدة معايير كمعامل خطأ الحرف (Character Error Rate) ونسب المتشابهة المصححة (Approximate Normalized Levenshtein Similarity) وغيرها من التقييمات.

ازدادت أيضًا أهمية التحسينات المستقلة، بما في ذلك تحسين ضبط المعلمات والمعالجة المسبقة التقليدية، مما أثبت فاعليته في رفع مستوى الأداء. ومع اختبار التأثيرات المختلفة لتدريب متعدد المراحل، أظهرت النتائج وجود توازن دقيق بين ضبط النموذج لمجموعات البيانات المحددة وإمكانية إدارته عبر عدة مجموعات بيانات. من خلال هذه البحث، يظهر أن استخدام نماذج رؤية-لغة خفيفة الوزن، حتى مع قيود المعلمات، قد يقدم بديلاً مستدامًا وفعالًا لاستخراج البيانات مقارنةً بالوسائل التقليدية.