🏷️ #تقييم
277 مقال
أبحاث
ثورة في تقييم الذكاء الاصطناعي: ROSE يقلب المعايير في تحويل اللغة الطبيعية إلى SQL
أركايف للذكاءمنذ 3 شهر
👁 1نماذج لغوية
ثورة في تقييم نماذج اللغة: League of LLMs يسجل قفزة مذهلة!
أركايف للذكاءمنذ 3 شهر
👁 1نماذج لغوية
ثورة في تقييم نماذج الذكاء الاصطناعي: تقييم دقيق لقدرات النماذج اللغوية
أركايف للذكاءمنذ 3 شهر
نماذج لغوية
ثورة في نماذج الرؤية-اللغة: مواجهة التحديات الجديدة وتفكيك الألغاز
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
قفزة نوعية في تقييم الأنتولوجيات: WiseOWL ت revolutionize إعادة استخدام البيانات!
أركايف للذكاءمنذ 3 شهر
أبحاث
جسر من التجربة إلى الإنتاج: كيف تغلق منصات تقييم الذكاء الاصطناعي الفجوة بين التجربة والإنتاج الفعلي؟
مدونة أوبن إيه آيمنذ 5 شهر
أبحاث
استكشاف OpenEnv: تقييم وكالات الذكاء الاصطناعي في بيئات حقيقية
هاجينج فيسمنذ 5 شهر
أبحاث
التعرّف على معيار RTEB: ثورة جديدة في تقييم استرجاع المعلومات!
هاجينج فيسمنذ 9 شهر
أبحاث
الإعلان عن مسابقة E2LM في NeurIPS 2025: تقييم مبكر لتدريب نماذج اللغات
هاجينج فيسمنذ 12 شهر
أبحاث
PaperBench: ثورة جديدة في تقييم قدرة الذكاء الاصطناعي على استنساخ الأبحاث!
مدونة أوبن إيه آيمنذ 15 شهر
نماذج لغوية
إعادة التفكير في تقييم نماذج اللغات الضخمة مع 3C3H: معايير AraGen واللوحة القيادية
هاجينج فيسمنذ 19 شهر
أدوات
Judge Arena: تجربة مبتكرة لتقييم نماذج الذكاء الاصطناعي
هاجينج فيسمنذ 20 شهر
أبحاث
إطلاق CyberSecEval 2: إطار تقييم شامل لمخاطر الأمن السيبراني وقدرات نماذج اللغة الكبيرة
هاجينج فيسمنذ 26 شهر
نماذج لغوية
خطوة جديدة نحو المستقبل: إطلاق قائمة المتصدرين لنماذج اللغات الكورية (Korean LLM Leaderboard)! 🚀
هاجينج فيسمنذ 29 شهر
أبحاث
استكشاف تحيز نماذج اللغات: كيف يمكن لـ 🤗 Evaluate تحسين العدالة في الذكاء الاصطناعي!
هاجينج فيسمنذ 45 شهر
👁 1أبحاث
إطلاق تقييم جديد على المنصة: ماذا يعني هذا لمستخدمي الذكاء الاصطناعي؟
هاجينج فيسمنذ 49 شهر
أبحاث
تقييم نماذج اللغات الضخمة: كيف تقود البرمجة الذكية نحو المستقبل؟
مدونة أوبن إيه آيمنذ 61 شهر
← السابق14 / 14
