في خطوة جديدة تُضاف إلى عالم الذكاء الاصطناعي، تم الكشف عن أداة AgentHorizon، وهي معيار يهدف إلى تقييم القضاة الذكيين (Agentic Judges) في مهام الحوسبة الطويلة. تجمع هذه الأداة بين 1,373 مهمة حاسوبية مستندة إلى تفاعلات بشرية، وتُظهر كيف يمكن أن تساهم الأساليب الحديثة في تحسين عملية تقييم الإنجازات بدون الحاجة لتدخل بشري.
حُدِدت الأداة من خلال تحليل مسارات طويلة من لقطات الشاشة والإجراءات، مما يفتح آفاقاً جديدة لفهم مدى نجاح المهام. فالأداة تهدف إلى تحديد الأخطاء المحتملة، حيث يجب على القاضي أن يقيم كل مسار بناءً على التعليمات المقدمة.
تم تصميم AgentHorizon بشكل يجمع بين المهام المتقاربة، مما يتيح إنشاء مهام سلبية عبر تبديل التعليمات. دراسات الأداة تشير إلى أن القاضي الأقوى، GPT-5.5، قادر على تحقيق دقة متوازنة تصل إلى 80.9% في مجموعة AH.
تُسلط النتائج الضوء على أهمية وجود قضاة ذكيين مرتبطين بالقدرة على معرفة وإثبات الأدلة المخفية التي تشير إلى اكتمال المهام بشكل صحيح، خاصة في السياقات التي تتطلب تفاعلات طويلة ومعقدة.
من المتوقع أن تقدم AgentHorizon توجهاً جديداً في التعامل مع قضايا تقييم الذكاء الاصطناعي وتعزز من قدرة الأنظمة الآلية على التعامل مع المهام المستمرة بكفاءة.
إنجاز مذهل في الذكاء الاصطناعي: الكشف عن AgentHorizon لتقييم القضاة الذكيين في المهام الممتدة!
تم تقديم أداة AgentHorizon، التي تقيم قدرة القضاة الذكيين في المهام الحاسوبية الممتدة، مما يعزز دقة التقييمات الآلية. الأداة تستند إلى قاعدة بيانات ضخمة تشمل 1,373 مهمة مسجلة من 166 ساعة من التفاعلات البشرية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
