تشهد نماذج اللغات الضخمة (LLMs) قفزة نوعية في قدرتها على دمج الذكاء الوكلي في معالجة المشكلات الرياضية، حيث تتجاوز مجرد تقديم إجابات نهائية. ومع ذلك، فإن معظم معايير الرياضيات الحالية تركز فقط على النتائج النهائية، مما يحد من قدرتها على تحديد الأخطاء في عمليات الحل أو المنطق الدقيق. في محاولة لتغيير هذا الوضع، تم تقديم معيار جديد يهدف إلى تقييم المهارات الرياضية الوكيلة لنماذج اللغات الضخمة.

يعمل هذا الإطار الجديد على ملاءمة سلوكيات الحلول الرياضية الوكيلة مع تصنيف منظم للقدرات الرياضية الأساسية القابلة لإعادة الاستخدام. تم تصميم مجموعة شاملة من المهام الخاصة بالتخطيط، وتنفيذ الإجراءات، وردود الفعل، تغطي كل من السياقات النصية ومتعددة الوسائط. هذا النظام مدعوم بخط أنابيب أوتوماتيكي يقوم بتوليد مسارات ذات جودة عالية وإنتاج تعليقات دقيقة عبر إعادة كتابة نماذج اللغات الضخمة بشكل مسيطر عليه.

تظهر التجارب أن النماذج التي تحقق نفس المستوى من الدقة النهائية يمكن أن تظهر اختلافات واضحة في ملفات قدراتها الوكيلة. وهذا يبرز أهمية التقييم على مستوى العمليات لفهم الإمكانيات الحقيقية لنماذج اللغات الضخمة وتوجيه تطوير وكالات الرياضيات من الجيل التالي.