في عالم الذكاء الاصطناعي، أصبح استخدام نماذج اللغات الضخمة (Large Language Models) لتقييم الأنظمة المعتمدة على الوكالة ضرورة ملحة. ومع ذلك، لا تزال موثوقية هذه النماذج في تقييم سير العمل المتسق المدفوع بالاعتماد غير مفحوصة بشكل كافٍ. \n \nهذا هو السبب وراء تقديم أداة AgentJudgeBench، أول معيار مصمم لدراسة موثوقية هذه النماذج كقضاة للأنظمة الوكيلة. تتضمن الأداة 3,808 حالة تشمل ستة توبولوجيات مختلفة من رسم البيانات الموجّهة المعتمدة على الاعتماد (DAG) وثلاث درجات صعوبة، ويتم تقييمها باستخدام خمسة مولدات متنوعة (من نماذج مفتوحة الوزن تتراوح من 3B إلى 70B وGPT-5.4) وأربعة قضاة (من 20B إلى مقاييس متقدمة) في ظل ظروف مع وبدون معلومات صحيحة. \n \nتشير النتائج إلى أن تماشي القضاة يتدهور ببطء مع زيادة صعوبة المهام، حيث كان ذلك أسرع بمعدل 1.5x في حالة عدم وجود معلومات صحيحة. في حالة الاستفسارات الصعبة دون معلومات صحيحة، تتقارب جميع القضاة الستة إلى نطاق ضيق يتراوح بين 77-82% بغض النظر عن المقاييس المستخدمة. وقد تكشف هذه النتائج عن سقف هيكلي مدفوع بشكل أساسي بصعوبة المهام، على الرغم من أن ارتفاعه يعتمد جزئياً على الإرشادات المستخدمة. \n \nلم تكن تجربة المعلومات الصحيحة مفيدة دائماً، حيث أظهرت الأرقام أن التعرض للمعلومات الصحيحة قد يُضعِف التوافق للنموذج GPT-5.4 بمقدار 1.5 نقطة مئوية، بينما بلغت النسبة 3.9 نقطة مئوية لنموذج Gemini-2.5-Pro. من بين الاستراتيجيات المقترحة، كانت تأثيرات التفكير السلسلسلة وحرارة القاضي محدودة، بينما حسنت الإرشادات المستندة إلى التقييم التوافق بمقدار يصل إلى 6.5 نقطة مئوية، لكنها لم تُظهر تناسقًا متساويًا عبر أزواج القضاة والمولدات. \n \nعندما تتوفر المعلومات الصحيحة، قدم النموذج QwQ-32B أفضل تطابق مع المرجعية البرمجية. بينما أظهرت دراسة التحقق البشري أن نموذج GPT-OSS-120B كان الأكثر توافقًا مع التجربة البشرية؛ ولكن بدون هذه المعلومات، تتفوق القضاة المتقدمة فقط بفارق طفيف ضمن السقف المشترك. \n \nتُبرز هذه النتائج القيود الأساسية الحالية للقضاة المعتمدين على نماذج اللغات الضخمة، وتقدم إرشادات عملية توفر إطارًا موثوقًا للتقييم في الأنظمة الوكيلة.