🏷️ #تقييم الأداء
167 مقال
أبحاث
اكتشاف LiveClawBench: المعيار الجديد لتقييم وكالات الذكاء الاصطناعي في المهام الحياتية المعقدة
أركايف للذكاءمنذ 3 شهر
نماذج لغوية
RoboLab: نقلة نوعية في محاكاة الروبوتات وتحليل السياسات العامة
أركايف للذكاءمنذ 3 شهر
أبحاث
قفزة مذهلة في الذكاء الاصطناعي: معيار Frontier-Eng لتقييم الوكلاء الذاتيين في مهام هندسية حقيقية!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
تحقيق إنجازات اقتصادية: OpenAI تطلق GDPval لتقييم أداء النماذج في المهام الحقيقية!
مدونة أوبن إيه آيمنذ 10 شهر
أبحاث
اكتشاف أخطاء GPT-4 بواسطة GPT-4: ثورة في تقييم الأداء!
مدونة أوبن إيه آيمنذ 25 شهر
نماذج لغوية
النماذج اللغوية الضخمة: كيف نقيم قوتها ونجاحها؟
هاجينج فيسمنذ 46 شهر
أبحاث
اكتشفوا Procgen Benchmark: ثورة في قياس مهارات الذكاء الاصطناعي!
مدونة أوبن إيه آيمنذ 80 شهر
← السابق9 / 9
