في عالم الذكاء الاصطناعي، أصبحت نماذج اللغات الضخمة (Large Language Models) تُستخدم بشكل متزايد كدرجات ومراجعين ومدققين للعمليات. لكنها، كما أظهرت دراسة جديدة، تواجه تحديات جسيمة في تقييم الحلول الرياضية الدقيقة.
تركز معظم التقييمات الرياضية التقليدية على دقة الإجابة النهائية فقط، مما قد يُخفي قدرة النموذج على التحقق من مسارات الحلول غير التقليدية التي قد تكون صحيحة. ومن هنا، نستعرض معياراً للتحقق من المعادلات الخطية لتقييم هذه النماذج في دور المُقّيم.
تتضمن كل حالة اختبار من النموذج حكم دقة الإجابة النهائية، وصحة مسار الحل خطوة بخطوة، وتحديد أول خطوة خاطئة. عند تقييم نماذج اللغة المفتوحة المتقدمة مثل GPT-OSS 20B وQwen3-14B وPhi-4-Reasoning، ظهرت فجوة واضحة في الموثوقية. حيث تتمكن هذه النماذج من تقييم الحلول التقليدية بدقة، إلا أنها تفشل بشكل كبير عند وجود تغييرات بسيطة على تلك الحلول.
تتراوح معدلات رفض الحلول الصحيحة بين 75.6% إلى 85.3% على المسارات المعدلة، مما يدل على حساسية كبيرة تجاه أشكال الحلول التقليدية. بالإضافة إلى ذلك، أظهرت تقنيات مثل التدريب تحت الإشراف، والتقطير، وزيادة حوسبة وقت الاختبار تحسناً في المتانة، ولكن هذه النتائج تختلف بحسب النموذج وتفرض قيوداً على الأداء التقليدي.
تظهر هذه النتائج أن التحقق الموثوق لمستوى العمليات لا يزال يمثل تحدياً، مما يستدعي قياس موثوقية المقيّم بشكل منفصل عن دقة الحل، حتى في مجالات الجبر البسيطة حيث تكون الحقيقة الأساسية دقيقة. هل ستغير هذه النتائج من طريقة استخدامنا لنماذج الذكاء الاصطناعي في المستقبل؟
تقييم متانة نماذج اللغات الضخمة: خطوة نحو التحقق الرياضي الدقيق!
تسليط الضوء على دراسة جديدة تُظهر فجوة كبيرة في موثوقية نماذج اللغات الضخمة (LLMs) عند تقييم الحلول الرياضية. النتائج تشير إلى صعوبة التحقق من الصحة العملية للبيانات، مما يطرح تحديات جديدة لمحترفي الذكاء الاصطناعي.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
