في عالم الذكاء الاصطناعي، حيث تلعب أدوات تقييم الأداء دورًا حاسمًا، أعلن الباحثون عن تطوير منهجية جديدة تدعى PartHackBench. تركز هذه المنهجية على تقييم أداء ما يسمى بـ "الوكلاء" (agents) في أوقات طويلة الأجل، حيث يمكن أن تتقدم هذه الأدوات دون الوصول إلى النجاح النهائي المطلوب.
تُثار تساؤلات عدة حول كيفية منح الأوسمة أو الدرجات للإنجازات، خاصةً عندما تكون هذه الإنجازات مؤقتة أو غير مرتبطة بالأداء الفعلي للأداة. مع ظهور PartHackBench، تم تقديم طريقة محكمة للتخلص من العوامل المربكة التي قد تؤثر على تقييم الأداء.
تعتمد PartHackBench على وجود جهة معتمدة خاصة تقيم "الثنائيات" (pairs) من الأدوات فقط عندما تتطابق مساراتها بصورة دقيقة في كل من متطلبات الحالة الحالية والنسب المحددة للأداة. يُقاس التضخم في الدرجات، وهو الفرق بين الدرجات الجديدة والقديمة، فقط بعد ذلك لتحقيق تقييم موضوعي.
في تجارب تم إجراؤها عبر 18 مهمة مختومة ضمن PB-CSTE، أظهرت النتائج أن المحاولات التاريخية المجمّدة أدت إلى وجود «أعداء» متطابقين في 15 مهمة. وكلما تم تقليل التضخم، كانت المعوقات أقل.
تظهر النتائج أن القضاة من نماذج اللغات الضخمة (Semantic LLM) كانوا أكثر مقاومة، لكنهم أيضًا تعرضوا للضعف في حالات معينة. ومع ذلك، كانت الضوابط الحالية ضمن PB-CSTE، التي عُرّفت كوظائف دقيقة للمكونات المعتمدة، قد حققت مستويات صفر من التضخّم. لذا، تقدم PartHackBench وسيلة موثوقة لاختبار ما إذا كانت ائتمانات المقيمين تتغير في حين تبقى جميع التقديرات المتعلقة بالمهام ثابتة.
ثورة جديدة في تقييم أدوات الذكاء الاصطناعي: الكشف عن PartHackBench
تم إطلاق PartHackBench، منهجية جديدة ثورية تهدف إلى تقييم أدوات الذكاء الاصطناعي بشكل أكثر دقة. تعالج هذه methodology المشكلات المتعلقة بالاعتمادية في تقييم الإنجازات الجزئية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
