تعتبر Datalog واحدة من اللغات الأساسية التي تدعم مهام التفكير مثل تحليل البرامج، ورغم ذلك، فإن كتابة برامجها تعد عملية معقدة. رحبت الأبحاث الحديثة بدخول نماذج اللغة الكبيرة (Large Language Models) في هذا المجال، حيث توفر طريقة أكثر طبيعية لتحويل النصوص إلى داتالوغ. ومع ذلك، فإن التقويم الدقيق لقدرتها على أداء هذه المهمة لم يتم تقييمه بشكل منهجي. هنا يأتي دور DatalogBench، وهو معيار جديد يضم 136 مهمة لتحويل النص إلى داتالوغ، تم تجميعها من مصادر داتالوغ الموجودة سابقًا.

تقوم البرامج المولدة بتقييم أدائها من خلال تنفيذها على مدخلات محددة، ومقارنتها بنتائج معيارية موثقة عبر تحليل التحول. أدت التجارب على ستة نماذج لغة كبيرة وأربعة تهيئات للبرمجة إلى تحقيق نسبة تطابقٍ بلغت 68.4%. بينما تؤثر أوصاف العلاقات أو أمثلة المدخلات والمخرجات بشكل طفيف على النتائج، إلا أن الفشل في التنفيذ يحدث في معظم الأحيان بسبب توليد النماذج لمتغيرات مساعدة لم يُعلن عنها.

ومع عمليات البرمجة المباشرة، تمكنت وكيلتين برمجة من تحقيق نسبة نجاح تصل إلى 83.8%، مع تقليل المشكلات الناتجة عن الأخطاء الهيكلية، ليبقى التركيز على الأخطاء الدلالية المتركزة في المهام التكرارية. تشير نتائج DatalogBench إلى أن التفكير التكراري والتحليل يعدان من التحديات المعلنة أمام النماذج والنظم البرمجية الحالية، مما يلوح بتحديات شائكة تأمل البحوث الحالية في التغلب عليها.