في عالم يتسارع فيه تطور الذكاء الاصطناعي (AI)، تأتي حاجة متزايدة لتقييم قدرات الأنظمة المتعددة اللغات التي تعتمد على نماذج اللغات الضخمة (Large Language Models). ومن هنا، يسر فريق من الباحثين تقديم معيار WorldBench، وهو معيار شامل يقيس الأداء في سياقات ثقافية حقيقية.

تسعى أداة WorldBench إلى سد الفجوات الموجودة في المعايير الحالية التي نادراً ما تختبر استدامة الأداء عبر اللغات وفي سيناريوهات واقعية. يتضمن المعيار 1600 مهمة عبر سبع لغات وثماني ثقافات، تم تحسينها بتعليقات من مختصين يمتلكون خبرات لغة وثقافة معينة.

لأغراض التقييم، يتم استخدام مقاييس متطورة تتضمن "نجاح المهمة المقيد" (Constrained Task Success - CTS)، والذي يعتبر طريقة مبتكرة لقياس نجاح المهام من خلال التعليمات الطبيعية وبيئات الاختبار. أظهرت التجارب أن النماذج الحديثة تصل فقط إلى 49.2% في CTS، مما يدل على الحاجة الملحة لتحسين هذه النماذج في بيئات متعددة الثقافات.

إن هذا المعيار يمثل خطوة حقيقية نحو تحسين قدرات وكالات الذكاء الاصطناعي والمساعدة على تقديم تجارب تفاعلية وآدمية أكثر، مما يفتح الأبواب لتطبيقات جديدة ومتنوعة في المستقبل القريب. كيف ترى تأثير هذا الابتكار على تطوير وتصميم أدوات الذكاء الاصطناعي المتعددة اللغات؟