في عالم الأعمال والصناعات، تُخزن الغالبية العظمى من البيانات في جداول وقواعد بيانات ومستودعات بيانات. لكن التعامل مع هذه البيانات الجدولية يُمثل تحديات كبيرة لنماذج اللغة الكبيرة (Large Language Models) بسبب التعقيد الكامن والأبعاد الهيكلية لهذه البيانات.

لملء الفجوة في هذا المجال، يقدّم الباحثون معيار TReB، الذي يُعتبر خطوة متقدمة نحو تقييم قدرات التفكير داخل الجداول. يتضمن هذا الإطار نظام تصنيف يمكنه قياس كل من القدرات السطحية والعميقة لفهم الجداول، مع تغطيته لمجموعة شاملة مكونة من 26 مهمة فرعية.

تعتمد منهجية TReB على إنشاء مجموعة بيانات عالية الجودة من خلال عملية معالجة وتوليد بيانات دقيقة. كما تم تصميم إطار تقييم يقيس قدرات التفكير في الجداول عبر ثلاثة أنماط استنتاجية مختلفة.

كشفت نتائج التجارب باستخدام هذا الإطار أن هناك مجالاً كبيراً لتحسين أداء نماذج اللغة الحالية في مواجهة المهام المعقدة المرتبطة بالجداول. والأهم من ذلك، أن مجموعة البيانات وإطار التقييم متاحان للجمهور، حيث يمكن العثور على مجموعة البيانات على Hugging Face وإطار التقييم على GitHub.

تستحق هذه الابتكارات اهتماماً خاصاً في عالم الذكاء الاصطناعي، حيث تسهم في تعزيز قدرات نماذج اللغة الكبيرة على تحليل البيانات وتقديم استجابات دقيقة، مما يفتح المجال لفرص جديدة في العديد من المجالات.