في عالم الذكاء الاصطناعي المتسارع، تزداد الحاجة إلى تحويل الوثائق الطويلة والمتنوعة إلى قواعد بياناتٍ قابلة للاستعلام، بدلًا من جداول البيانات المنعزلة. المجالات مثل المالية، والرعاية الصحية، والتعليم، وعمليات النقل، تتطلب أنظمة تحليل معقدة تعتمد على مخططات معيارية، وهويات الكيانات، والعلاقات بين الجداول.
تظهر الفجوة الكبيرة في المعايير الحالية للتحويل من الوثيقة إلى الجدول حيث يمكن أن يؤدي تبسيط البيانات إلى تكرار وأنماط غير واضحة للعلاقات، كما يُمكن أن يتسبب في تفشي السجلات المفرطة ويصعب اختبار مدى صحة الحقائق المستخرجة. ولأن هذه المشكلة تُعتبر ملحة، تم تقديم معيار جديد يُطلق عليه Doc2DB-Bench، والذي يُعد خطوة مبتكرة في تقييم فهم الوثائق.
يحتوي Doc2DB-Bench على 203 حالة وثيقة طويلة موزعة عبر 42 مخططاً وسبع مجموعات مجالات، بما في ذلك 117 جدول كيان و132 جدول علاقات، ويضم 7,341 صفاً و41,935 خلية. تم بناء هذا المعيار من خلال عملية تنظير قابلة للتحكم، بالإضافة إلى تصنيف لعمليات استخراج داخل الجدول والتفكير بين الجداول. والجدير بالذكر أن الوثائق المولدة تخضع للتحقق من صحتها، مما يُثبت عدم تمييزها عن المراجع الواقعية.
بهذا، يوفر Doc2DB-Bench نقطة انطلاق لتطوير أنظمة البيانات المعتمدة على نماذج لغات ضخمة (LLMs) بشكل موثوق وقابل للتدقيق والحفاظ على العلاقات الضرورية.
تحويل الوثائق إلى قواعد بيانات: اكتشفوا قوة Doc2DB-Bench الجديد!
قدمت الأبحاث الجديدة معيارًا ثوريًا يُعرف باسم Doc2DB-Bench لتحويل الوثائق الطويلة إلى قواعد بيانات قابلة للاستعلام، مما يسد فجوة كبيرة في تقييم فهم الوثائق. هذا الابتكار يعد بتقديم طرق أكثر موثوقية لبناء أنظمة البيانات المعتمدة على نماذج اللغات الضخمة (LLMs).
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
