في عصر التحولات الرقمية، أصبح استخراج المعلومات الهيكلية من الوثائق غير المنظمة أحد المكونات الأساسية لمختلف القطاعات، وخاصة في القطاع العام حيث تكتسب دقة البيانات وزنًا كبيرًا. ومع هيمنة الحلول المملوكة على التطبيقات التجارية، بدأنا نشهد انفجارًا في الأنظمة المفتوحة المصدر، بدءًا من محركات التعرف الضوئي على الحروف (OCR) وصولًا إلى نماذج اللغات الضخمة (LLMs) ونماذج الرؤية واللغة (VLMs).

لكن دراسات تقييم فعالية هذه النماذج لا تزال نادرة، وخاصة في السيناريوهات الواقعية. وهنا تبرز أهمية دراسة جديدة تقدم مرجعية شاملة لتقييم الأداء الكامل للأنظمة المفتوحة المصدر في معالجة الوثائق الحقيقية، والتي تم تصنيفها بكونها عالية المخاطر بموجب قانون الذكاء الاصطناعي في الاتحاد الأوروبي.

تمت الدراسة باستخدام طلبات الطلاب لبرامج الدراسة الدولية كنموذج لتحديات استخراج المعلومات. وقد أظهرت النتائج أن نماذج VLM بشكل عام تتفوق على تركيبات OCR وLLM، رغم أن الأساليب الحديثة من النماذج المفتوحة المصدر تواجه صعوبة كبيرة في معالجة مثل هذه المهام بدقة وكفاءة.

خذها بعين الاعتبار، فقط 4 من أصل 35 تكوينًا حققوا درجات F1 تفوق 0.5. كما أظهرت النتائج أن العلاقة بين حجم النموذج والأداء غير خطية، حيث أن النماذج الأكبر لا تضمن نتائج أفضل. وفي الوقت نفسه، كانت جودة المدخلات، وخاصة الحفاظ على الهيكلية في إخراج OCR، عاملًا حاسمًا يؤثر على فعالية الأنظمة.

لذا، إذا كنت تعمل في مشروع حكومي أو تسعى إلى معرفة المزيد عن تحسين عمليات استخراج المعلومات، فإن هذه الدراسة تقدم رؤى هامة تستحق القراءة والتأمل. في النهاية، هل تعتقد أن الأنظمة المفتوحة المصدر يمكن أن تحقق ثورة في كيفية التعامل مع البيانات في القطاعات العامة؟ شاركونا آراءكم في التعليقات.