Ailoxa Logo

🏷️ #تقييم

379 مقال

نماذج لغوية صغيرة خاصة: شركاء مثاليون في تصميم تقييمات التعليم!
أبحاث

نماذج لغوية صغيرة خاصة: شركاء مثاليون في تصميم تقييمات التعليم!

أركايف للذكاءمنذ 3 شهر
هل_agents جاهزون لتعليمنا؟ معايير جديدة لتقييم قدرة الوكلاء في التعليم
أبحاث

هل_agents جاهزون لتعليمنا؟ معايير جديدة لتقييم قدرة الوكلاء في التعليم

أركايف للذكاءمنذ 3 شهر
👁 1
ثورة في مقاييس تقييم نماذج الذكاء الاصطناعي: كيفية تشكيل الثقافة من خلال المعايير
أبحاث

ثورة في مقاييس تقييم نماذج الذكاء الاصطناعي: كيفية تشكيل الثقافة من خلال المعايير

أركايف للذكاءمنذ 3 شهر
👁 2
شكرًا ل ChromaFlow: دراسة مبتكرة تكشف النقاب عن تحديات تقييم الوكلاء المدعومين بالأدوات
أبحاث

شكرًا ل ChromaFlow: دراسة مبتكرة تكشف النقاب عن تحديات تقييم الوكلاء المدعومين بالأدوات

أركايف للذكاءمنذ 3 شهر
تحسين وتقييم خرائط الخصائص التفسيرية للذكاء الاصطناعي: طُرق مبتكرة ونتائج مبهرة!
أبحاث

تحسين وتقييم خرائط الخصائص التفسيرية للذكاء الاصطناعي: طُرق مبتكرة ونتائج مبهرة!

أركايف للذكاءمنذ 3 شهر
ابتكار جديد في تقييم إزالة الأجسام من الصور: PROVE يحسن الدقة الإدراكية
أبحاث

ابتكار جديد في تقييم إزالة الأجسام من الصور: PROVE يحسن الدقة الإدراكية

أركايف للذكاءمنذ 3 شهر
تجارة الماشية: معيار متعدد الوكلاء لتقييم قدرات نماذج اللغة الكبيرة في استراتيجيات المقامرة والمساومة
أبحاث

تجارة الماشية: معيار متعدد الوكلاء لتقييم قدرات نماذج اللغة الكبيرة في استراتيجيات المقامرة والمساومة

أركايف للذكاءمنذ 3 شهر
تقييم مبتكر للذكاء الاصطناعي: تعزيز الأداء عبر نماذج اللغة الكبيرة!
أبحاث

تقييم مبتكر للذكاء الاصطناعي: تعزيز الأداء عبر نماذج اللغة الكبيرة!

أركايف للذكاءمنذ 3 شهر
👁 1
ثورة في تقييم نظم الحوار الطبية: نموذج آلي يضمن موثوقية التقييم!
أبحاث

ثورة في تقييم نظم الحوار الطبية: نموذج آلي يضمن موثوقية التقييم!

أركايف للذكاءمنذ 3 شهر
تعزيز موثوقية التقييم من خلال نموذج متعدد المستويات للمحكمين: خطوة نحو تحقيق العدالة في الذكاء الاصطناعي
أبحاث

تعزيز موثوقية التقييم من خلال نموذج متعدد المستويات للمحكمين: خطوة نحو تحقيق العدالة في الذكاء الاصطناعي

أركايف للذكاءمنذ 3 شهر
ثورة جديدة في تقنيات الذكاء الاصطناعي: منهج RTLC يعزز دقة نماذج اللغة الكبيرة دون تعديل!
أبحاث

ثورة جديدة في تقنيات الذكاء الاصطناعي: منهج RTLC يعزز دقة نماذج اللغة الكبيرة دون تعديل!

أركايف للذكاءمنذ 3 شهر
ثورة الذكاء الاصطناعي في العناية المركزة: كيف يُقيم RealICU قدرات نماذج اللغة العملاقة في تحليل البيانات الطويلة؟
أبحاث

ثورة الذكاء الاصطناعي في العناية المركزة: كيف يُقيم RealICU قدرات نماذج اللغة العملاقة في تحليل البيانات الطويلة؟

أركايف للذكاءمنذ 3 شهر
👁 1
DisaBench: ثورة في تقييم مخاطر الإعاقات في نماذج اللغة!
أبحاث

DisaBench: ثورة في تقييم مخاطر الإعاقات في نماذج اللغة!

أركايف للذكاءمنذ 3 شهر
👁 1
هل تقدر المعايير أداء نماذج اللغة الكبيرة بشكل كافٍ؟ اكتشاف الاستدلالات بدقة من خلال التقييمات البشرية!
أبحاث

هل تقدر المعايير أداء نماذج اللغة الكبيرة بشكل كافٍ؟ اكتشاف الاستدلالات بدقة من خلال التقييمات البشرية!

أركايف للذكاءمنذ 3 شهر
هل تستطيع نماذج اللغة الضخمة تقدير صعوبات الطلاب؟ دراسة جديدة تكشف عن تحديات ملائمة صعوبات التعلم مع الذكاء الاصطناعي
أبحاث

هل تستطيع نماذج اللغة الضخمة تقدير صعوبات الطلاب؟ دراسة جديدة تكشف عن تحديات ملائمة صعوبات التعلم مع الذكاء الاصطناعي

أركايف للذكاءمنذ 3 شهر
👁 1
اكتشفوا GraphBench: النقلة النوعية في تقييم تعلم الرسوم البيانية!
أبحاث

اكتشفوا GraphBench: النقلة النوعية في تقييم تعلم الرسوم البيانية!

أركايف للذكاءمنذ 3 شهر
👁 1
AU-Harness: الأداة المفتوحة لتقييم شامل لنماذج اللغة الصوتية
أدوات

AU-Harness: الأداة المفتوحة لتقييم شامل لنماذج اللغة الصوتية

أركايف للذكاءمنذ 3 شهر
MECAT: معيار جديد ثوري لفهم الصوت مع دقة فائقة!
أبحاث

MECAT: معيار جديد ثوري لفهم الصوت مع دقة فائقة!

أركايف للذكاءمنذ 3 شهر
ثورة في تقييم نماذج الذكاء الاصطناعي: كيف يكشف تعدد الأجيال عن قيمة جديدة
أبحاث

ثورة في تقييم نماذج الذكاء الاصطناعي: كيف يكشف تعدد الأجيال عن قيمة جديدة

أركايف للذكاءمنذ 3 شهر
نموذج المكافأة المرتبطة بالتخطيط: ثورة في تقييم وكالات الذكاء الاصطناعي
أبحاث

نموذج المكافأة المرتبطة بالتخطيط: ثورة في تقييم وكالات الذكاء الاصطناعي

أركايف للذكاءمنذ 3 شهر