في عالم الذكاء الاصطناعي المتسارع، تحقق نماذج اللغات الضخمة (Large Language Models) إنجازات لافتة في الأداء على المعايير الرياضية التقليدية. ومع ذلك، كيف يمكن أن تتأثر هذه القدرات عند مواجهة سياقات تركيبية معينة؟ هنا يأتي دور مؤشر التفكير المتين (Robust Reasoning Benchmark) الذي تم تقديمه حديثًا.

يتألف هذا المؤشر من 13 تغييرًا نصيًا حتميًا تم تطبيقه على المسابقات المرتبطة بـ AIME 2024 وAIME 2025. في اختبار 8 نماذج من أحدث طراز، تبيّن أن النماذج الرائدة تُظهر صلابة ملحوظة، باستثناء نموذج Claude الذي يتجنب بشكلٍ قاطع العديد من المطالب المعاد تشكيلها.

تظهر نماذج استدلال الأوزان المفتوحة مجموعة من أنماط الفشل تحت الضوضاء الهيكلية، مثل الاضطراب الإدراكي، وانهيار التقطيع، وانهياج التفكير، حيث تصل معدلات الدقة إلى 54% تحت المتوسط وتصل إلى 100% في بعض الحالات.

علاوةً على ذلك، درسنا أحد أنماط الفشل هذه على حدة: **تخفيف الانتباه** الناتج عن سلسلة التفكير الخاصة بالنموذج. من خلال تكليف النماذج بحل مشاكل رياضية مستقلة بشكل متتابع ضمن نافذة سياقية واحدة، توصلنا إلى ظاهرة تُعرف باسم **تخفيف الانتباه الداخلي (Intra-Query Attention Dilution)**.

تظهر نماذج الأوزان المفتوحة، بدءًا من 7 مليارات وصولًا إلى 120 مليار معلمة، تدهورًا في الدقة عند محاولة حل المشكلات اللاحقة، مما يشير إلى أن خطوات التفكير الوسيطة تلوث آليات الانتباه الكثيفة القياسية.

نعارض، من أجل تحقيق تفكير موثوق، الحاجة إلى دمج إعادة تعيين سياقية صريحة ضمن سلسلة التفكير الخاصة بالنماذج، مما يفتح باب الأسئلة البحثية حول المعايير المثلى لمهام التفكير.

ما رأيكم في هذا التطور؟ شاركونا في التعليقات.