في عالم الذكاء الاصطناعي المتطور، يُعتبر التفكير الاجتماعي (Social Reasoning) أحد التحديات الكبيرة التي تواجه نماذج اللغة الضخمة (Large Language Models). حيث يتعين على هذه النماذج التعاون والتفاوض والتكيف في بيئات متعددة الوكلاء، الأمر الذي يتطلب مهارات اجتماعية دقيقة يصعب قياسها.

لذلك، تم ابتكار بيئة جديدة تُدعى Social Gym، التي تضم 21 لعبة اجتماعية متعددة الوكلاء مثل (Werewolves) و(Resistance) و(Spyfall)، مما يتيح قياس أداء وكلاء الذكاء الاصطناعي بموضوعية. تعتمد نتائج هذه الألعاب على قواعد صارمة، مما يجعلها قابلة للتحقق منه، وتوفر تصنيفاً شاملاً للنتائج.

ومن خلال الاختبارات، تم اكتشاف أن نموذج GPT-5-mini يتصدر قائمة المتسابقين، لكن لا يوجد نموذج يتألق في جميع الألعاب بشكل متساوٍ، مما يسلط الضوء على القيود الحالية في التفكير الاجتماعي.

لمعالجة هذه القيود، تم تقديم نهج جديد يُعرف بـ SPaRTan (Self-Play and Reflect-Transfer)، والذي يُعتبر حلقة تحسين ذاتية دون الحاجة إلى تدريب مستمر. حيث يقوم النموذج بلعب لعبة، ثم يراجع تجاربه ونتائجها ليُنتج دليل ألعاب يمكن تطبيقه لاحقاً، مما يساعد النماذج على تحسين أدائها في الأدوار الضعيفة.

تشير نتائجنا إلى أن دلائل SPaRTan تساعد وكلاء GPT-5-mini في رفع مستويات أدائهم، بينما لم تُظهر تحسينات ملحوظة لأداء نموذج Qwen3-32B. هذه التطورات المبتكرة تُوفر أساساً متكرراً وقابلاً للتحقق من قياس وتحسين التفكير الاجتماعي في نماذج اللغة الضخمة دون الحاجة إلى تحديثات الوزن.