في السنوات الأخيرة، أصبح تقييم أداء الوكلاء البرمجيين (Coding Agents) يشمل ليس فقط ما إذا كانوا قادرين على حل المهام، ولكن أيضًا كيف يقومون بتنفيذ تلك المهام. بينما تعودنا على تقييم أداء الوكلاء استنادًا فقط إلى النتائج النهائية، فإن لدينا الآن حاجة ملحة لفهم الطرق التي يتبعها هؤلاء الوكلاء لتحقيق أهدافهم.
في هذا السياق، يسلط البحث الجديد الضوء على نقاط الضعف الموجودة في التقييمات التقليدية، حيث يشتبه في أن معظمها تعالج تنبؤات الأفعال، وعدم اليقين المتعلق بالمهام، ونسب الخطوات كأنها قضايا واحدة متجانسة. ولكن في الواقع، هذه الجوانب تحتاج إلى تقييمات منفصلة لتوضيح ما تقيسه تلك التقييمات بشكل دقيق.
يقدم البحث إطارًا جديدًا لتقييم العمليات في الوكلاء البرمجيين، حيث يتم تقديم نموذج لتحديد نسبة التأثير بين الخطوات (Step-level Causal Attribution) من خلال Estimator يدعى SCAE، وهو نموذج مشتق من نموذج سببي هيكلي ينظم كيفية تنفيذ الوكلاء لمهامهم.
يتم دمج هذا الإطار مع تقنيات مثل التحديد المشروط على الأسبقية، والتقدير القائم على التدخل، والتلاعب بالمعلومات الخاصة بالحكم المدروس لدراسة تقييم العمليات على مستويات الأفعال، والمهام، والخطوات.
تظهر التجارب التي أجريت على 499 حلقة لتحديد المواقع في 12 مستودعًا نتائج مثيرة، حيث يتضح أن أفعال الوكلاء تتأثر أساسًا بأصول التنفيذ بدلاً من الانتقالات بين الرسوم البيانية للكود، كما أن عدم اليقين التنفيذي يتشكل عند مستوى المهام وليس مستوى الخطوات. بالإضافة إلى ذلك، فعندما يستخدم الحكام التامون للخط، يظهر تحيزات منهجية، مما يشير إلى أن التقييمات الحالية في كثير من الأحيان تقيس الصلة السسيامية بدلاً من المساهمة السببية المعتمدة.
من خلالها، يصلنا هذا البحث إلى فهم أعمق حول كيفية تقييم الوكلاء البرمجيين، مما يمهد الطريق لتحسين الأدوات والأساليب المستخدمة في هذا المجال.
كيف يقيم الباحثون أداء الوكلاء البرمجيين؟ اكتشفوا المستويات الثلاثة المختلفة للتقييم!
يتناول هذا المقال الإطار الجديد لتقييم أداء الوكلاء البرمجيين، حيث يوضح كيف يمكن لأساليب القياس المتقدمة أن تفكك العمليات المعقدة وتوضح الفروقات الجوهرية بين المستوى التنفيذي، مستوى المهام، ومستوى الخطوات. اقرأ لتعرف المزيد حول النتائج المثيرة!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
