تتطلب الأبحاث القانونية التجريبية تحويل النصوص غير المنظمة إلى متغيرات منظمة، وهو ما يعتبر تحديًا تقنيًا كبيرًا. تعتمد عملية الترجمة هذه في مجال حوكمة الشركات على الترميز البشري للوثائق مثل الميثاق واللوائح، مما يجعلها عملية تكلف الكثير من الوقت والموارد.

ومؤخراً، قدمت الورقة البحثية DECODEM مجموعة من البيانات القياسية التي تهدف إلى تحسين هذه العملية. تشمل هذه البيانات مجموعة من الميثاق واللوائح العشوائية المصحوبة بتعليقات بشرية عالية الجودة تغطي مجموعة واسعة من أحكام الحوكمة المستخدمة في الأبحاث التجريبية.

تسمح هذه البيانات للباحثين بتقييم عدة نماذج لغوية ضخمة (Large Language Models) لاستخراج المعلومات. حيث تتضمن المهمة الرئيسية تصنيف وثائق بمستوى ثنائي، مما يساعد في تحديد فعالية النماذج المختلفة.

تشير النتائج إلى أن الاستخراج الآلي ممكن بدقة عالية للعديد من الأحكام، حيث وصل الأداء إلى مستوى جيد للغاية. ومع ذلك، يتفاوت الأداء اعتمادًا على المتغيرات، مما يعني أن عددًا قليلاً من الأحكام يسبب أخطاء في النتائج. لا تؤدي استراتيجيات التوجيه الأكثر تعقيدًا دائمًا إلى تحسين الأداء بشكل ملحوظ، ولكنها تساعد في تقليل الفجوة بين النماذج الأمامية والنماذج المبنية على الكفاءة.

يوفر هذا البحث معيارًا موحدًا وتقييمًا منهجيًا لطرق الاستخراج، مما يظهر أن النماذج الحالية قادرة على استخراج معلومات قانونية ذات دلالة من وثائق الشركات المعقدة بدقة عالية. هذا النوع من استخراج الميزات الآلي يمكن أن يلعب دورًا مهمًا في بناء بيانات الحوكمة الخاصة بالشركات مستقبلًا.