في خطوة جديدة تُضاف إلى عالم الذكاء الاصطناعي، تم الكشف عن أداة AgentHorizon، وهي معيار يهدف إلى تقييم القضاة الذكيين (Agentic Judges) في مهام الحوسبة الطويلة. تجمع هذه الأداة بين 1,373 مهمة حاسوبية مستندة إلى تفاعلات بشرية، وتُظهر كيف يمكن أن تساهم الأساليب الحديثة في تحسين عملية تقييم الإنجازات بدون الحاجة لتدخل بشري.
حُدِدت الأداة من خلال تحليل مسارات طويلة من لقطات الشاشة والإجراءات، مما يفتح آفاقاً جديدة لفهم مدى نجاح المهام. فالأداة تهدف إلى تحديد الأخطاء المحتملة، حيث يجب على القاضي أن يقيم كل مسار بناءً على التعليمات المقدمة.
تم تصميم AgentHorizon بشكل يجمع بين المهام المتقاربة، مما يتيح إنشاء مهام سلبية عبر تبديل التعليمات. دراسات الأداة تشير إلى أن القاضي الأقوى، GPT-5.5، قادر على تحقيق دقة متوازنة تصل إلى 80.9% في مجموعة AH.
تُسلط النتائج الضوء على أهمية وجود قضاة ذكيين مرتبطين بالقدرة على معرفة وإثبات الأدلة المخفية التي تشير إلى اكتمال المهام بشكل صحيح، خاصة في السياقات التي تتطلب تفاعلات طويلة ومعقدة.
من المتوقع أن تقدم AgentHorizon توجهاً جديداً في التعامل مع قضايا تقييم الذكاء الاصطناعي وتعزز من قدرة الأنظمة الآلية على التعامل مع المهام المستمرة بكفاءة.