في عالم الذكاء الاصطناعي، يتطلب اختيار نظام الوكيل (Agent System) اتخاذ قرار بشأن نموذج اللغة (Language Model) وكذلك الجهاز الذي يعمل من خلاله. تقدم دراسة جديدة تقييماً لمدى تباين الأداء عندما تتغير الإعدادات، وذلك من خلال تحليل 66 تكويناً مختلفاً لنماذج وأجهزة متنوعة.

تم استخدام أربعة أجهزة قابلة للتكوين، وهي OpenHands وDeepSeek Harness وPI وopenJiuwen، وارتبطت مع خمسة نماذج مختلفة عبر ثلاثة معايير تقييم مثل TUA-Bench وALE-CLI وTerminal-Bench 4. أظهرت النتائج أن تصنيفات النماذج تختلف بين الأجهزة، مما يشير إلى أن الاختيار الصحيح للنموذج والمدعومة قد يكون أكثر تعقيداً مما يبدو.

على سبيل المثال، في معيار Terminal-Bench 4، تصدرت Claude نموذج GPT بفارق يصل إلى 7.94 نقطة عند استخدام OpenHands، لكنها تراجعت بـ30.16 نقطة عند استخدام PI. وما هو مثير للاهتمام، أن الاختيار الأفضل للجهاز يختلف من معيار لآخر، لكنه أظهر وجود بعض التوافقات القوية؛ حيث حقق openJiuwen أعلى درجاته مع Kimi في جميع المعايير الثلاثة.

تظهر النتائج أن الجهاز المدعوم من قبلموفر النموذج ليس بالضرورة الأكثر فعالية، وأن التكلفة الأعلى لا تعني دائماً أداءً أعلى. في حالة Terminal-Bench 4، حقق GPT نتائج أفضل تحت PI بتكلفة أقل من ربع التكلفة لكل مهمة عند استخدام DSH. في بعض الحالات، تبدأ النماذج جميع الإصلاحات بنفسها، مما يعني أن نجاحها يعتمد بشكل كبير على كيفية إعادة تقديم الجهاز للأخطاء في شكل يمكن للنموذج استخدامه.

يحقق GPT أفضل أداء مع بنية PI الرشيقة، بينما يحصل Kimi، الذي غالباً ما يصدر دعوات أدوات غير صحيحة، على أفضل نتائج في openJiuwen. بالنهاية، تؤكد الدراسة على الحاجة لتقييم النموذج والجهاز والمهمة معًا، وتتيح لك الاطلاع على ملحقات الأجهزة، وشيفرات التقييم، وجميع المسارات المحصورة بـ 6,204 عبر الروابط المتاحة.