في ظل التطورات المتسارعة التي تشهدها مجالات الذكاء الاصطناعي ونماذج اللغة الكبيرة (LLMs)، يأتي معيار MultiGlobeQA ليطرح تحديات جديدة تتعلق بالقدرة على التفكير الجغرافي. تم تصميم هذا المعيار ليشمل أكثر من 46,000 زوج من الأسئلة والأجوبة التي تعكس تنوع اللغات والثقافات، ليكون بذلك اختبارًا شاملًا لمهارات هذه النماذج في معالجة المعلومات الجغرافية.

على الرغم من احتواء نماذج اللغة الكبيرة على كم هائل من المعلومات الجغرافية، إلا أن التحديات المرتبطة بالحسابات الهندسية والتوبولوجية لا تزال تؤثر على أدائها. وهذا يسلط الضوء على الحاجة إلى معيار مثل MultiGlobeQA الذي يضم 14 نوعًا من الوظائف المكانية و15 صيغة للإجابة.

يعتمد معيار MultiGlobeQA على ثلاث قواعد بيانات معرفية، ويشمل استبيانات تغطي 201 دولة عبر تصنيفات الدخل والكثافة. تم تصميم الأسئلة بالتوازي بين الإنجليزية و16 لغة أخرى لضمان تغطية شاملة وغنية.

على الرغم من الفوائد المحققة بإدخال أدوات الاسترجاع والاستخدام، إلا أن الأداء يبقى أقل من المتوقع في بعض المهام، مما يدل على أن الحساب، وليس الوصول إلى المعرفة، هو العقبة الأساسية. وهناك أيضًا تفاوت في الأداء في المناطق ذات الدخل المنخفض، مما يستدعي ضرورة تعزيز النموذج ليكون أكثر شمولية.