في عالم الذكاء الاصطناعي، يُعتبر التفكير الذهني (Mentalization) - القدرة على استنتاج معتقدات ونوايا الآخرين لتوجيه اختيارات الفرد - أحد الوظائف المعرفية الأساسية التي تدعم التفاعلات الاجتماعية بين البشر. في الآونة الأخيرة، أظهرت نماذج اللغة الكبيرة (LLMs) سلوكيات متوافقة مع البشر في مهام التفكير الذهني، لكن ما زال من غير الواضح ما إذا كانت تلك النماذج يمكن أن تقود سلوكًا تكيفيًا من خلال هذه القدرة.

تستخدم دراسة جديدة ألعابًا اقتصادية مع نماذج حسابية معرفية للكشف عن الاستراتيجيات الأساسية لتفكير الذهني في نماذج اللغة الكبيرة. تم اختبار عملاء LLM بشكل فردي عبر أربعة عائلات نموذجية، تضم DeepSeek، وGPT-4.1، وGPT-5، وGemini 2.0 Flash، مقارنةً بمنافسين مختلفين من حيث التعقيد، وتم تقييم ما إذا كانت الاستراتيجيات الموجهة لتحفيز التفكير الاستراتيجي حسنت من الأداء.

تم أخذ نتائج الأنموذجين جنبا إلى جنب مع المقاييس البشرية (251 مشارك) كمرجع للمقارنة. عبر جميع الألعاب، أظهرت النماذج المختلفة توقيعات سلوكية وحسابية واضحة لتفكير الذهني، ولكنها اختلفت بشكل ملحوظ حسب المزود وحجم النموذج. أظهرت الاستراتيجيات الاستفزازية عمومًا تحسنًا في الأداء من خلال استثارة تفكير أكثر تعقيدًا، ولكن مدى الاستفادة كان متبايناً بين المهمتين.

الأهم من ذلك، أن عملاء GPT-5 تكيّفوا بمرونة مع تعميق استنتاجاتهم في مواجهة المنافسين الأكثر تعقيدًا، مما أظهر أداءً متفوقًا على المشاركين البشريين. تجتمع هذه النتائج لتؤكد على وجود قدرات متنوعة لتفكير الذهني عبر نماذج اللغة الكبيرة، وتبرز الأهمية الحيوية للنمذجة الحاسوبية المعرفية كطريقة رسمية لتقييم الذكاء المقارن بين البشر والآلات.

ما رأيكم في هذه النتائج المذهلة؟ هل تعتقدون أن نماذج الذكاء الاصطناعي يمكن أن تتفوق على البشر في فهم نوايا الآخرين؟ شاركونا آرائكم في التعليقات!