في عالم المعلومات، تمثل عملية استخراج الجداول من النصوص محورا هاما للأنظمة المعلوماتية، ومع تزايد الاعتماد على نماذج اللغة الكبيرة (Large Language Models) في هذا السياق، برز إطار جديد يدعى TEAR. هذا الإطار يتميز بالقدرة على التعامل مع نصوص طبيعية مثل تلك الموجودة في التقارير الإخبارية ووسائل التواصل الاجتماعي، مما يعكس الحاجة الملحة للتكيف مع النصوص غير المتخصصة.

التحديات التي يطرحها استخراج المعلومات من هذه النوعية من النصوص عديدة؛ يتعلق أولها بالتنوع الكبير والافتقار إلى المؤشرات الهيكلية الواضحة، مما يجعل التعليمات الثابتة لنماذج اللغة غير كافية لتحديد حدود الاستخراج بدقة. ثانيًا، ليس بوسع المخططات المعرفة مسبقًا التقاط السمات الجديدة غير المرئية في النصوص الطبيعية، مما يخلق فجوة في الجودة والتحليل.

لحل هذه التحديات، يقدم TEAR نهجًا مبتكرًا يضم سير عملين متكاملين: واحد لاستخراج الجداول يسمح بتكييف التعليمات بشكل ديناميكي، وآخر لتوصية السمات، والذي يساعد في اكتشاف السمات الجديدة من النصوص لتكملة المخطط المعرفي. بفضل هذا الإطار، يتمكن الباحثون والمطورون من تصميم مخططات استكشافية تتمحور حول نصوص حقيقية.

ومن خلال تقييم TEAR باستخدام مجموعة بيانات حقيقية وموارد قياسية محددة، تظهر التجارب أن إطار TEAR يحقق أداءً متفوقًا في المهمتين، مما يبرز فعالية السمات الموصى بها في تعزيز أداء الاستخراج في السيناريوهات الاستكشافية. هذا الإنجاز لا يعد فقط خطوة نحو الأمام في مجال استخراج البيانات، بل هو أيضًا دعوة للابتكار في تحليل المعلومات.