في عالم تطور وكالات البرمجة، تواجهنا عوائق تحليل الأداء من خلال المقارنات التقليدية بين النماذج. حيث تكشف دراسة حديثة منشورة على arXiv عن "تأثير السقالات" في كيفية تقييم هذه الوكالات، مبرزة أن اختيار السقالة (Harness) يلعب دورًا خفيًا ولكنه حاسم يتجاوز مجرد نسبة النجاح.
عادة ما تُقارن الوكالات البرمجية بناءً على اسم النموذج (Model Name) ونسبة النجاح (Pass Rate)، إلا أن الدراسة توضح كيف تؤثر البيئة المحيطة بها بشكل كبير، مما يجعل من الصعب التفرقة بين تأثير النموذج والسقالة. تم إجراء تقييم لكل من نموذج Qwen 3.6 Plus وMiniMax M2.5 عبر ثلاث سقالات مفتوحة المصدر: Goose وOpenCode وOpenHands-SDK، مع عينة تتألف من 50 مهمة من مجموعة البيانات Terminal-Bench Pro.
من النتائج المدهشة أن الاختيار المعني بالسقالة يؤثر بشكل كبير على عدد الرموز (Tokens) المستخدمة لكل مهمة مكتملة، حيث يصل الفارق إلى 40 مرة. في حين أن الفروق في نسب النجاح بين النماذج تظل ضمن 0-8 نقاط مئوية. يبرز البحث كذلك عيوب الأداء المشتركة عبر النماذج، مما يدل على وجود انحيازات على مستوى السقالات بدلاً من أن تكون مرتبطة بالنموذج بحد ذاته.
في الختام، يؤكد الباحثون على أن تقييم الوكلاء البرمجيين يستوجب النظر في اختيار السقالات المعنية بجانب النماذج، موصين بالاعتماد على معدل النجاح تحت ميزانيات الرموز والزمن، فضلاً عن الإبلاغ عن استخدام الرموز والوقت، بالإضافة إلى المواصفات الكاملة للسقالات. تضمن الدراسة توصيل المعلومات بأمان، حيث تم نشر التكوينات غير المُعَرَّفة وسجلات التجارب الخام واللوجات المجملة وشفرة التحليل.
ما رأيكم في أهمية اختيار السقالات في تقييم وكالات البرمجة؟ شاركونا آرائكم في التعليقات.
تأثير السقالات في تقييم وكلاء البرمجة: استغلال الاختيار كمتغير خفي
تقدم الدراسة تحليلًا متعمقًا لكيفية تأثير اختيار السقالة في تقييم أداء وكلاء البرمجة. النتائج تظهر فروقات هائلة في الأداء تتجاوز مجرد مقارنة النماذج.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
