تشهد نماذج اللغات الضخمة (LLMs) قفزة نوعية في قدرتها على دمج الذكاء الوكلي في معالجة المشكلات الرياضية، حيث تتجاوز مجرد تقديم إجابات نهائية. ومع ذلك، فإن معظم معايير الرياضيات الحالية تركز فقط على النتائج النهائية، مما يحد من قدرتها على تحديد الأخطاء في عمليات الحل أو المنطق الدقيق. في محاولة لتغيير هذا الوضع، تم تقديم معيار جديد يهدف إلى تقييم المهارات الرياضية الوكيلة لنماذج اللغات الضخمة.
يعمل هذا الإطار الجديد على ملاءمة سلوكيات الحلول الرياضية الوكيلة مع تصنيف منظم للقدرات الرياضية الأساسية القابلة لإعادة الاستخدام. تم تصميم مجموعة شاملة من المهام الخاصة بالتخطيط، وتنفيذ الإجراءات، وردود الفعل، تغطي كل من السياقات النصية ومتعددة الوسائط. هذا النظام مدعوم بخط أنابيب أوتوماتيكي يقوم بتوليد مسارات ذات جودة عالية وإنتاج تعليقات دقيقة عبر إعادة كتابة نماذج اللغات الضخمة بشكل مسيطر عليه.
تظهر التجارب أن النماذج التي تحقق نفس المستوى من الدقة النهائية يمكن أن تظهر اختلافات واضحة في ملفات قدراتها الوكيلة. وهذا يبرز أهمية التقييم على مستوى العمليات لفهم الإمكانيات الحقيقية لنماذج اللغات الضخمة وتوجيه تطوير وكالات الرياضيات من الجيل التالي.
من الحسابات إلى الذكاء: كيف تقيّم نماذج اللغات الضخمة قدراتها الرياضية المتطورة!
تتطور نماذج اللغات الضخمة (LLMs) لتصبح وكيلة ذكية قادرة على أداء مهام رياضية معقدة. تقوم الدراسة الجديدة بتقديم إطار عمل لتقييم قدراتها الرياضية بشكل أكثر دقة وتحليلًا.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
