في عالم البرمجة المتطور، يكمن التحدي في فهم مدى قدرة وكيل البرمجة (Coding Agent) على اتباع التعليمات بفعالية. وقد قدم الباحثون أداة جديدة تُعرف بـ Harness-IF، والتي تغير قواعد التقييم المعتاد. بدلاً من الاعتماد على النجاح النهائي للمهمة فقط، تعمل Harness-IF على تقييم القواعد انطلاقًا من الأدلة التنفيذية.
تتضمن Harness-IF مجموعة من 60 عنصرًا واقعيًا تمت صياغتها بعناية من مكتبة تحتوي على 642 قاعدة، حيث يتم تقييم 256 قاعدة من خلال إثباتات تنفيذية. تكمن أهمية هذه الأداة في قدرتها على فصل بين الالتزام بالعناصر المتضمنة وصدفة النجاح، وذلك بفضل إدخال مفهوم "دقة متينة ضد الأولويات (Against-Prior Accuracy - AP-Acc)".
تشير الإحصاءات الأولية إلى أن دقة النماذج يتم تقييمها بين 72.1% و 85.9%، بينما دقة AP-Acc تتراوح بين 66.1% و 78.6%. يُظهر أن كل نموذج يعاني من انخفاض ملحوظ في الأداء عند التعامل مع القواعد المعاكسة ضد الأولويات، مما يبرز عمق المشكلة وقدرتها على كشف الضعف في النماذج.
تعتبر هذه النتائج مهمة بالنظر إلى أن الدرجات الإجمالية قد تكون مبالغ فيها حسب الخصائص المحددة للنموذج، وبالتالي فإن Harness-IF توفر رؤية أوضح وموضوعية أكثر لتقييم الأداء الفعلي لوكلاء البرمجة.
انطلاق Harness-IF: أداة ثورية لتقييم استجابة وكيل البرمجة للتعليمات
تقدم Harness-IF طريقة مبتكرة لتقييم كيفية استجابة وكيل البرمجة للتعليمات، مما يكشف عن مدى فعالية النموذج في اتباع القواعد. من خلال قياس دقيق، تمكن هذه الأداة من فرز الاستجابة الصحيحة عن العفوية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
