في ظل التطورات المستمرة في نماذج اللغة الكبيرة (Large Language Models)، تظل القدرة على القيام بالتفكير الاستنتاجي المنطقي عبر تفاعلات مطولة تمثل تحديًا كبيرًا. تتطلب المهام التي تدمج الأدلة على مدار عدة خطوات، المحافظة على الاتساق مع الاستنتاجات السابقة، وتحديث المعتقدات بناءً على قيود جديدة، اختبارات دقيقة للقدرات الحالية لهذه النماذج.

في دراسة حديثة نشرت على موقع arXiv، تم تفعيل تجربة جديدة تستند إلى لعبة Clue الكلاسيكية كبيئة لتقييم التفكير الاستنتاجي متعدد الخطوات. في هذه البيئة، يتعين على الوكلاء استنتاج معلومات مخفية من تسلسل من الملاحظات، مع الحفاظ على الاتساق عبر الأدوار، والتفكير في مجموعة متطورة من القيود المنطقية.

تم تطبيق ستة وكلاء معتمدين على LLMs (مثل GPT-4o-mini وGemini-2.5-Flash) كمتنافسين في هذه اللعبة، مما أتاح تقييم الأداء الأساسي على مدار عدة جولات.

وفي خطوة مبتكرة، تم تقديم نهج معزز بالأدوات، حيث تم تحويل حالة اللعبة الغامضة من سجلات الاستنتاج المُنتَجة إلى تمثيل واضح للإمكانيات المتبقية عبر مصفوفة احتمالات منظمة. تُسجل مصفوفة الاحتمالات ذاكرة الدور الممتدة والقيود الاستنتاجية، مما يخفف من عبء هذه المهام عن الوكيل.

يجري مقارنة هذا النهج المعزز بالأدوات مع الأداء الأساسي لتقييم كيف أن تعزيز الأدوات يُسهم في رفع جودة التفكير ونجاح المهام للجهات المستقلة في بيئة تفكير استراتيجية. هذه الخطوة تمثل تقدمًا ملحوظًا في تطوير نماذج اللغة الكبيرة وتطبيقاتها في معالجة التحديات المعقدة.