في عالم قواعد البيانات الحديثة، تُعتبر دقة تنفيذ استعلامات SQL من الأمور الحاسمة للنجاح. ومع تقدم نماذج تحويل اللغة الطبيعية إلى SQL (NL2SQL) حتى بلغت دقة التنفيذ أكثر من 89% على مجموعة معايير مثل Spider وBIRD، كان هناك مجال لتحسين أدائها في البيئات المؤسساتية الأكثر تعقيدًا.

لذا، تم تقديم معيار ESQ-Bench كحلاً مبتكرًا يركز على تقييم نماذج NL2SQL في بيئات قواعد البيانات المؤسسية. يعتمد ESQ-Bench على معايير دقيقة تُقسم إلى مستويات تقنية معقدة، مما يجعله معيارًا موثوقًا لتقدير الأداء الفعلي لتلك النماذج.

بهذا، تم إنشاء ستة مخططات بيانات غنية مفهرسة تحتوي على 465 جدولًا و164,682 صفًا، مما يضمن عدم وجود جداول فارغة. ويشمل ESQ-Bench أيضًا أربعة مقاييس تقييم (EM، EX، SR، SD)، بالإضافة إلى 550 زوج من الأسئلة والاستعلامات المعتمدة.

تظهر نتائج التحليل الفشل في تحقيق دقة عالية في المستويات الأعلى، حيث كان للدلالات الصامتة أثر كبير في إحداث انحرافات. لكن الأنباء الجيدة تأتي من Claude Sonnet 4.6 الذي تفوق على GPT-4o في كل مستوى من مستويات التقييم. بهذه الطريقة، يسلط ESQ-Bench الضوء على أهمية التصدي لمشكلات الفجوات في الأداء في بيئات البيانات المؤسسية المعقدة.

ما رأيكم في هذا التطور الثوري في معايير البيانات؟ شاركونا في التعليقات.