تتطور النماذج اللغوية الكبيرة (LLMs) نحو مستوى مثير للإعجاب من الدقة في الفحوصات الرياضية القياسية، حتى أنها حققت أداءً يضاهي الفائزين بالميداليات الذهبية في الأولمبياد الرياضي الدولي. ومع ذلك، يتزايد التحدي مع تكرار استخدام نفس المعايير، مما يؤدي إلى فقدان مصداقية النتائج. في ضوء هذه التحديات، قدم الباحثون منهجية جديدة تُعرف باسم GAP (Generalisation-and-Perturbation) لتقييم الأداء الرياضي بشكل أكثر دقة.
تقوم منهجية GAP على توليد متغيرات رياضية معادلة لمشكلات موجودة، مما يعزز القدرة على اختبار طريقة التفكير الرياضية للنماذج. يتم تنفيذ ذلك من خلال نوعين من التحولات المفسرة: التحولات السطحية التي تدرس العلاقة بين المعرّفات وأدوار المتغيرات الخفية، وإعادة الكتابة الأساسية التي تستكشف ما إذا كانت الخطة البرهانية تظل سليمة عند تغيير السياق الرياضي.
قام الباحثون بتطبيق GAP على جميع مشكلات مسابقة وليم لويل بوتنام من عام 1938 حتى 2024، مشكلين مجموعة بيانات مكونة من 6,306 عنصرًا تمثل تحديًا حقيقيًا للنماذج اللغوية. ومن خلال استخدام مجموعة بيانات PutnamGAP، تم تقييم 18 نموذجًا تجاريًا ومفتوح المصدر، حيث لوحظ أن الدقة تقل عبر جميع النماذج، خاصة تحت إعادة الكتابة الأساسية، مما يشير إلى أن نقاط الضعف الشائعة تكمن في قدرة النماذج على نقل خطط الإح Proof إلى سياقات رياضية جديدة.
توضح هذه الدراسة كيف يمكن تحسين التفكير الرياضي في النماذج اللغوية من خلال استكشاف أبعاد جديدة من الأداء، مما يعكس الحاجة المستمرة للتطوير...
ثورة في تفكير النماذج اللغوية: دراسة جديدة تكشف نقاط الضعف في الاستدلال الرياضي
تقدم دراسة حديثة منهجية جديدة لتقييم قدرة النماذج اللغوية الكبيرة (LLMs) على التعامل مع المشكلات الرياضية من خلال توليد أشكال رياضية معادلة. تكشف النتائج عن نقاط ضعف محددة في استدلال هذه النماذج، مما يفتح آفاقًا جديدة لتحسين أدائها.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
