Ailoxa Logo

🏷️ #تقييم

277 مقال

ثورة في تقييم الذكاء الاصطناعي: ROSE يقلب المعايير في تحويل اللغة الطبيعية إلى SQL
أبحاث

ثورة في تقييم الذكاء الاصطناعي: ROSE يقلب المعايير في تحويل اللغة الطبيعية إلى SQL

أركايف للذكاءمنذ 3 شهر
👁 1
ثورة في تقييم نماذج اللغة: League of LLMs يسجل قفزة مذهلة!
نماذج لغوية

ثورة في تقييم نماذج اللغة: League of LLMs يسجل قفزة مذهلة!

أركايف للذكاءمنذ 3 شهر
👁 1
ثورة في تقييم نماذج الذكاء الاصطناعي: تقييم دقيق لقدرات النماذج اللغوية
نماذج لغوية

ثورة في تقييم نماذج الذكاء الاصطناعي: تقييم دقيق لقدرات النماذج اللغوية

أركايف للذكاءمنذ 3 شهر
ثورة في نماذج الرؤية-اللغة: مواجهة التحديات الجديدة وتفكيك الألغاز
نماذج لغوية

ثورة في نماذج الرؤية-اللغة: مواجهة التحديات الجديدة وتفكيك الألغاز

أركايف للذكاءمنذ 3 شهر
👁 1
قفزة نوعية في تقييم الأنتولوجيات: WiseOWL ت revolutionize إعادة استخدام البيانات!
أبحاث

قفزة نوعية في تقييم الأنتولوجيات: WiseOWL ت revolutionize إعادة استخدام البيانات!

أركايف للذكاءمنذ 3 شهر
جسر من التجربة إلى الإنتاج: كيف تغلق منصات تقييم الذكاء الاصطناعي الفجوة بين التجربة والإنتاج الفعلي؟
أبحاث

جسر من التجربة إلى الإنتاج: كيف تغلق منصات تقييم الذكاء الاصطناعي الفجوة بين التجربة والإنتاج الفعلي؟

مدونة أوبن إيه آيمنذ 5 شهر
استكشاف OpenEnv: تقييم وكالات الذكاء الاصطناعي في بيئات حقيقية
أبحاث

استكشاف OpenEnv: تقييم وكالات الذكاء الاصطناعي في بيئات حقيقية

هاجينج فيسمنذ 5 شهر
التعرّف على معيار RTEB: ثورة جديدة في تقييم استرجاع المعلومات!
أبحاث

التعرّف على معيار RTEB: ثورة جديدة في تقييم استرجاع المعلومات!

هاجينج فيسمنذ 9 شهر
الإعلان عن مسابقة E2LM في NeurIPS 2025: تقييم مبكر لتدريب نماذج اللغات
أبحاث

الإعلان عن مسابقة E2LM في NeurIPS 2025: تقييم مبكر لتدريب نماذج اللغات

هاجينج فيسمنذ 12 شهر
PaperBench: ثورة جديدة في تقييم قدرة الذكاء الاصطناعي على استنساخ الأبحاث!
أبحاث

PaperBench: ثورة جديدة في تقييم قدرة الذكاء الاصطناعي على استنساخ الأبحاث!

مدونة أوبن إيه آيمنذ 15 شهر
إعادة التفكير في تقييم نماذج اللغات الضخمة مع 3C3H: معايير AraGen واللوحة القيادية
نماذج لغوية

إعادة التفكير في تقييم نماذج اللغات الضخمة مع 3C3H: معايير AraGen واللوحة القيادية

هاجينج فيسمنذ 19 شهر
Judge Arena: تجربة مبتكرة لتقييم نماذج الذكاء الاصطناعي
أدوات

Judge Arena: تجربة مبتكرة لتقييم نماذج الذكاء الاصطناعي

هاجينج فيسمنذ 20 شهر
إطلاق CyberSecEval 2: إطار تقييم شامل لمخاطر الأمن السيبراني وقدرات نماذج اللغة الكبيرة
أبحاث

إطلاق CyberSecEval 2: إطار تقييم شامل لمخاطر الأمن السيبراني وقدرات نماذج اللغة الكبيرة

هاجينج فيسمنذ 26 شهر
خطوة جديدة نحو المستقبل: إطلاق قائمة المتصدرين لنماذج اللغات الكورية (Korean LLM Leaderboard)! 🚀
نماذج لغوية

خطوة جديدة نحو المستقبل: إطلاق قائمة المتصدرين لنماذج اللغات الكورية (Korean LLM Leaderboard)! 🚀

هاجينج فيسمنذ 29 شهر
استكشاف تحيز نماذج اللغات: كيف يمكن لـ 🤗 Evaluate تحسين العدالة في الذكاء الاصطناعي!
أبحاث

استكشاف تحيز نماذج اللغات: كيف يمكن لـ 🤗 Evaluate تحسين العدالة في الذكاء الاصطناعي!

هاجينج فيسمنذ 45 شهر
👁 1
إطلاق تقييم جديد على المنصة: ماذا يعني هذا لمستخدمي الذكاء الاصطناعي؟
أبحاث

إطلاق تقييم جديد على المنصة: ماذا يعني هذا لمستخدمي الذكاء الاصطناعي؟

هاجينج فيسمنذ 49 شهر
تقييم نماذج اللغات الضخمة: كيف تقود البرمجة الذكية نحو المستقبل؟
أبحاث

تقييم نماذج اللغات الضخمة: كيف تقود البرمجة الذكية نحو المستقبل؟

مدونة أوبن إيه آيمنذ 61 شهر