تتطلب أنظمة الإجابة على الأسئلة المعقدة التي تعتمد على المعرفة اختيار الأدلة وتجميع الحقائق المعتمدة بشكل متسلسل. ولكن، غالبًا ما تترجم المعايير متعددة اللغات عينة كاملة إلى لغة واحدة، مما يخفي إخفاقات عند حدود اللغة داخل سلسلة الاستدلال. هنا يأتي دور معيار XHotpotQA، الذي يُعتبر معيارًا متحكمًا لتركب المعرفة عبر لغات مختلفة من خلال الأدلة المختلطة.

يُعد كل نموذج في XHotpotQA بمثابة رسم بياني يعتمد على الأدلة، حيث تُخصص مخصصات لغوية محددة لكل من السؤال، والأدلة المتصلة، والأدلة الحاملة للإجابة، والموارد المشتتة. يحتوي هذا المورد المدقق على 15,661 عينة تدريب و7,405 عينة تحقّق، مع دعم إشرافي على مستوى جمل وموارد مشتتة مقدمة.

تشير البيانات إلى أن 99.81% من العناصر تستخدم واجهة لغة السؤال إلى الأدلة الذهبية، بينما 95.60% تعتمد على فقرات ذهبية من لغات مختلفة. في حالة عدم تناسق السؤال والأدلة المعتادة، ترتبط النتائج السلبية بنسبة تتراوح ما بين 10.25 إلى 15.79 نقطة أقل من درجات F1 المعتمدة على Unicode. في ظل هذا التصميم المقدم، يكشف XHotpotQA عن تشخيصات واعية للدور، وتقييمات معيارية، وبيئة اختبار مفحوصة للأنظمة المعتمدة على المعرفة التي تحتاج إلى دمج الأدلة عبر اللغات.

هل تتوقعون أن يُحدث XHotpotQA تأثيرًا على تطوير أنظمة الذكاء الاصطناعي في المستقبل؟ شاركونا آراءكم في التعليقات!