في عالم الذكاء الاصطناعي، تتطور أساليب تقييم نماذج اللغات الكبيرة (LLMs) نحو فهم أعمق لعملية التفكير وليس فقط الدقة النهائية للإجابات. ورغم تلك التطورات، فإن الطرق التقليدية لا تزال تفتقر إلى تحليل كيفية تنظيم النماذج لأساليب البحث وتخصيص الموارد. هنا يأتي دور *تسوغو*، كمقياس ثوري جديد يركز على كفاءة البحث في نماذج الذكاء الاصطناعي من خلال استخدام تحديات الحياة والموت في لعبة *Go*.

تعتبر تحديات *Go* مثالية بسبب هيكلها المعقد ووجود فضاءات حلول مغلقة يمكن التحقق منها، مما يتطلب من النماذج إجراء مقارنات دقيقة بين الفروع والتراجع عند الضرورة. بفضل تسوغو، أصبح بإمكان الباحثين فصل المعرفة المتعلقة بالمجال عن تنظيم البحث وتحليل سلسلة الأفكار (CoT) إلى شجرة بحث منظمة، بالإضافة إلى قياس كفاءة البحث جنبًا إلى جنب مع كفاءة الرموز (Token Efficiency) ومقاييس تشخيصية أخرى.

تشير التجارب الأولية إلى أن النماذج الحالية لا تزال بعيدة عن الاستقرار في حل تحديات *تسوميجو* (Tsumego): حيث تنجح النماذج القوية في تحديد المرشحين الصحيحين في وقت أقصر، لكنها لا تزال تتصرف بشكل أكثر قربًا من خوارزميات البحث غير الموجهة. وتظهر النتائج أيضًا أن تحسين طول سلسلة الأفكار أو كفاءة الرموز لا يعني بالضرورة تحقيق بحث أفضل.

في الختام، تبرز تسوغو كأداة جديدة هامة في تقييم تفكير نماذج الذكاء الاصطناعي، مشيرة إلى ضرورة توسيع أبعاد التقييم لتشمل تنظيم البحث وتخصيص موارد التفكير. ما رأيكم في هذا التطور الثوري؟ شاركونا آرائكم في التعليقات.