في عالم تكنولوجيا المعلومات والتطوير البرمجي، يعتبر الوكلاء البرمجيون (Coding Agents) من الأدوات المبتكرة التي تحتاج إلى تقييم دقيق لضمان كفاءتها. لكن كيف يمكننا التأكد من أن هذه الوكلاء ينفذون مهامهم على أكمل وجه؟ هنا يأتي دور معيار Agent Retrieval Bench، وهو معيار جديد يركز على تقييم دقة استرداد الملفات الضرورية لأداء المهام.
يحدث تقييم الوكلاء عادةً من خلال النظر في ما إذا كانوا قد أنتجوا تصحيحات صحيحة، لكن هذه الخطوة تعتمد على مرحلة سابقة مهمة وهي استرداد السياق المناسب (Context Acquisition). نحتاج أولاً إلى العثور على الملفات المطلوبة في المستودع (Repository) لتحقيق هذه المهام. وقد تم تطوير معيار Agent Retrieval Bench ليعالج هذه المشكلة من خلال توفير معيار على مستوى الملفات.
يتضمن هذا المعيار 427 عينة تم جمعها من 25 مستودع برمجي، تشمل 345 مثالاً إيجابياً، بالإضافة إلى 50 مثالاً طبيعياً و32 نموذجاً موازياً خاطئاً. يتم تقييم الأداء بناءً على الحاجة التالية للوكلاء بدلاً من تشابه المعاني المباشرة بين الملفات. تشمل المهام الإيجابية رصد أربعة مجالات من استرداد الملفات: من الكود إلى الاختبار (code2test)، ومن التعليقات إلى السياق (comment2context)، ومن تتبع الكود إلى التعديل (trace2code)، وأخيراً من التعديل إلى التأثير (edit2ripple).
تُظهر نتائج الاختبارات عدم سيطرة مجموعة استرداد واحدة، حيث حققت نماذج Qwen3-Embedding المتعددة نتائج مختلفة بين العينات الإيجابية ونجاح استدعاء 20. وتبين الدراسة أيضاً أن الحدود الانتقائية المستخدمة لم تُحسن من النجاح في الحالات الطبيعية غير المثالية.
باختصار، يبرز معيار Agent Retrieval Bench كخطوة جبارة نحو تحسين تقييم أداء الوكلاء البرمجيين، وفتح أفق جديد لفهم كيفية استرداد السياقات بشكل أكثر فعالية. ما رأيكم في هذه التطورات الجديدة؟ شاركونا في التعليقات!
ثورة جديدة في تطوير الوكلاء البرمجيين: كشف النقاب عن معيار Agent Retrieval Bench!
استعرض الباحثون معياراً جديداً لتقييم أداء الوكلاء البرمجيين من خلال التركيز على مرحلة استرداد السياق. يعرف معيار Agent Retrieval Bench بمساهمته الكبيرة في تحسين دقة استرداد الملفات المطلوبة في مهام البرمجة.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
