في خطوة رائدة نحو تعزيز قدرات الذكاء الاصطناعي باللغة العربية، تم إطلاق مجموعة بيانات E-CONAN (Entailment, CONtradiction And Neutral) التي تُعنى بتقييم استنتاج النصوص. تُعرف استنتاج اللغة الطبيعية (Natural Language Inference) بأنها عملية تحلل أزواج الجمل لاستخراج العلاقات الدلالية بينها. ورغم التقدم الملحوظ في هذا المجال عبر لغات عديدة، لا تزال اللغة العربية تواجه تحديات كبيرة بسبب قلة الموارد المتاحة.

تم تطوير مجموعة بيانات E-CONAN لسد هذه الفجوة، حيث تتكون من عدة مصادر تشمل: (1) أزواج جمل مترجمة آليًا، (2) أزواج جمل مترجمة بواسطة إنسان، (3) أزواج جمل مُعدة من كتب تدريس اللغة العربية للناطقين بغيرها، و(4) عناوين من قنوات إخبارية مختلفة تحتوي على إشاعات.

تشمل E-CONAN مجموعتين قياسيتين: E-CONAN-2، وهي مجموعة بيانات ثنائية، وE-CONAN-3، وهي مجموعة بيانات ثلاثية. استخدمت هذه المجموعات لتقييم تسعة نماذج متعددة اللغات تم تدريبها مسبقًا باستخدام تقنية التصنيف بدون تدريب (zero-shot classification) على بيانات ArNLI وXNLI وE-CONAN، وأظهرت النتائج أن E-CONAN تمثل موردًا قيمًا لتقييم عمومية النماذج وحتى للتحسين الدقيق للنماذج المدربة مسبقًا.

تتميز E-CONAN بتنوعها واحتوائها على مضامين مستمدة من مصادر متعددة، مما يوفر تقييمًا أوسع وأكثر دقة مقارنةً بـ XNLI وArNLI. كما تم تقييم خمسة نماذج من نماذج اللغات الضخمة (Large Language Models) على مجموعة بيانات E-CONAN-3، بما في ذلك MARBERT كنموذج أساسي خاص باللغة العربية.

تأتي مجموعة بيانات E-CONAN مع تحليل شامل للأخطاء الشائعة، مما يساعد الباحثين على فهم التحديات التي تواجه النماذج في سياق اللغة العربية. ونتطلع أن تثري هذه المجموعة الجديدة المجتمع البحثي وتساهم في تطوير استنتاج النصوص والفهم اللغوي في اللغة العربية.