في خطوة مبتكرة لتقييم أداء نماذج اللغات الكبيرة (Large Language Models) في تنبؤ نتائج الأحداث الرياضية، تم تقديم معيار جديد يسمى WC2026-Agents. يعتمد هذا المعايير على كأس العالم 2026 ويستهدف تقييم قدرة النماذج على التنبؤ بمباريات كرة القدم بشكل مستقل.

خلال البطولة، سيتعين على أربعة نماذج متقدمة، وهي Claude Opus 4.8 وChatGPT (GPT-5.5) وGemini 3.1 Pro وGrok (وضع الخبراءالعمل ضمن حلقة جماعية متكررة تجمع الأدلة باستخدام أدوات الويب وتثبيت توزيعات التنبؤ (1X2) للمباريات مع رهان افتراضي قدره 100 دولار.

من المهم أن نلاحظ أن جميع مباريات البطولة قد بدأت بعد انتهاء تدريب النماذج، مما يجعل التقييم خاليًا من التلوث. بالإضافة إلى ذلك، ستتنافس هذه النماذج مع توقعات سوق المراهنات، مما يوفر قاعدة بيانات اقتصادية مُحكمة لتقييم قدرات النماذج.

بالنظر إلى 416 توقعًا و414 تحليلًا مبنيًا على النتائج النهائية، تبرز النتائج أن النماذج الأربعة تشترك في نفس الخيار الأفضل في 92% من المباريات، لكنها لا تتفوق على نقاط Brier الخاصة بسوق المراهنات. ومع ذلك، هناك تباين واضح في قرارات النماذج؛ حيث تتراوح العائدات من -18% إلى +10%، ويشار إلى أن التباين في قدرة النماذج على تقدير الأداء هو محور التركيز.

إجمالًا، يقيس هذا المعيار جودة القرارات والقدرة على التنبؤ المعتمد، مما يكشف الفروقات بين النماذج الرائدة حتى عندما تأتي تنبؤاتها متشابهة. إذًا، كيف ترون استخدام الذكاء الاصطناعي في التنبؤ بمباريات كأس العالم؟ شاركونا آراءكم في التعليقات!