في عالم البرمجة المتطور، يُعد تقييم وكلاء البرمجة أحد التحديات المهمة. وقد تمثل الحاجة إلى أدوات جديدة يمكن أن تقيم أداء هؤلاء الوكلاء بشكل أكثر دقة أهمية كبيرة. وفي هذا السياق، أُطلق معيار ProgramDistill، وهو معيار جديد يهدف إلى تقييم وكلاء البرمجة بناءً على سلوكيات استُنبطت من تفاعلاتهم مع تطبيقات مرجعية كاملة.
يعتمد معيار ProgramDistill على تجزئة التطبيقات إلى ميزات بمستويات مختلفة من الدقة، حيث يتم ربط كل ميزة بسلوكيات قابلة لإعادة التشغيل، مما يسهل قياس أداء الوكلاء في مختلف السيناريوهات. هذا المعيار يعتمد على pipeline مبتكر يُدعى "mine-craft-patch"، الذي يكتشف 1,975 سلوك تم التحقق منه من خلال الإرجاع عبر 26 تطبيقًا، ويتم إنشاء 4,063 مهمة دون الحاجة إلى تدخل بشري.
تم اختبار تسعة من وكلاء البرمجة على هذا المعيار، حيث حقق كل من GPT-6 Astra وClaude Opus 5 نجاحًا بنسبة 49.2% و28.8% في إعادة بناء التطبيقات بالكامل. ومع ذلك، يظهر أن النجاح ينخفض بشكل كبير في إعادة بناء التطبيقات الجزئية، حيث يتراجع الأداء من 100% إلى 64% بمعدل عمق استعادة يتراوح من 1 إلى 8.
توفر هذه المعايير ليس فقط وسيلة لتقييم الأداء، ولكن أيضًا قاعدة طبيعية لتدريب الوكلاء على أساس المناهج في المستقبل. في ضوء هذه الإنجازات، يُعتبر ProgramDistill نقلة نوعية في عالم تقييم البرمجة وتقنيات الذكاء الاصطناعي.
برنامج ProgramDistill: ثورة جديدة في تقييم وكلاء البرمجة عبر تطبيقات الويب التفاعلية!
أطلق الباحثون معياراً جديداً لتقييم وكلاء البرمجة يعتمد على التفاعل مع تطبيقات مرجعية كاملة. هذا المعيار يُظهر قدرة وكالات الذكاء الاصطناعي على استنتاج سلوكيات البرمجة واستكمال التطبيقات الناقصة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
