Ailoxa Logo

🏷️ #معايير تقييم

53 مقال

كفاءة الذكاء الاصطناعي في البحث العلمي: تعرف على LifeSciBench!
أبحاث

كفاءة الذكاء الاصطناعي في البحث العلمي: تعرف على LifeSciBench!

مدونة أوبن إيه آيمنذ 1 شهر
ATOM-Bench: معيار جديد يكشف مهارات الروبوتات وتحديات الابتكار
أبحاث

ATOM-Bench: معيار جديد يكشف مهارات الروبوتات وتحديات الابتكار

أركايف للذكاءمنذ 1 شهر
ثورة في الرعاية الصحية: إطلاق معيار EHRNote-ChatQA لتقييم الأسئلة السريرية المستندة إلى الأدلة!
أبحاث

ثورة في الرعاية الصحية: إطلاق معيار EHRNote-ChatQA لتقييم الأسئلة السريرية المستندة إلى الأدلة!

أركايف للذكاءمنذ 1 شهر
CreativeBench: معيار جديد لتحسين إبداع الآلات من خلال التحديات الذاتية التطور
أبحاث

CreativeBench: معيار جديد لتحسين إبداع الآلات من خلال التحديات الذاتية التطور

أركايف للذكاءمنذ 1 شهر
تقنية GeoNatureAgent: ثورة في تحليل البيانات البيئية عبر الذكاء الاصطناعي!
أبحاث

تقنية GeoNatureAgent: ثورة في تحليل البيانات البيئية عبر الذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر
👁 1
مدCTA: معيار جديد لقياس أداء وكلاء الأدوات الطبية بذكاء اصطناعي!
أبحاث

مدCTA: معيار جديد لقياس أداء وكلاء الأدوات الطبية بذكاء اصطناعي!

أركايف للذكاءمنذ 1 شهر
OpenVTON-Bench: قفزة نوعية في تقييم تجربة ارتداء الملابس الافتراضية!
أبحاث

OpenVTON-Bench: قفزة نوعية في تقييم تجربة ارتداء الملابس الافتراضية!

أركايف للذكاءمنذ 1 شهر
تحذير! اكتشاف معيار جديد للكشف عن تأثّر وكلاء الويب بالتحويرات الخادعة
أبحاث

تحذير! اكتشاف معيار جديد للكشف عن تأثّر وكلاء الويب بالتحويرات الخادعة

أركايف للذكاءمنذ 1 شهر
Hedge-Bench: معيار جديد لتقييم أداء الوكلاء في مهام التحليل المالي المعقدة!
أبحاث

Hedge-Bench: معيار جديد لتقييم أداء الوكلاء في مهام التحليل المالي المعقدة!

أركايف للذكاءمنذ 1 شهر
👁 1
إعادة التفكير في معايير اختبارات البناء الكيميائي: هل تستطيع نماذج اللغة الكبيرة (LLMs) تحقيق المستحيل؟
أبحاث

إعادة التفكير في معايير اختبارات البناء الكيميائي: هل تستطيع نماذج اللغة الكبيرة (LLMs) تحقيق المستحيل؟

أركايف للذكاءمنذ 1 شهر
👁 1
إعادة تفكير في تقييم التعلم المعزز: هل تكشف المعايير عن عيوب فعالية الطرق؟
أبحاث

إعادة تفكير في تقييم التعلم المعزز: هل تكشف المعايير عن عيوب فعالية الطرق؟

أركايف للذكاءمنذ 1 شهر
👁 1
Harness-Bench: ثورة في قياس تأثيرات الهياكل على نماذج الذكاء الاصطناعي في بيئات العمل الواقعية!
أبحاث

Harness-Bench: ثورة في قياس تأثيرات الهياكل على نماذج الذكاء الاصطناعي في بيئات العمل الواقعية!

أركايف للذكاءمنذ 1 شهر
ثورة جديدة في تقييم نماذج التنبؤ: كيف يمكن أن تغير المعايير الجديدة عالم الذكاء الاصطناعي؟
أبحاث

ثورة جديدة في تقييم نماذج التنبؤ: كيف يمكن أن تغير المعايير الجديدة عالم الذكاء الاصطناعي؟

أركايف للذكاءمنذ 1 شهر
اكتشاف معايير جديدة للقيادة الذاتية: Drive-P2D لتقييم الفهم واتخاذ القرار بشكل متكامل
أبحاث

اكتشاف معايير جديدة للقيادة الذاتية: Drive-P2D لتقييم الفهم واتخاذ القرار بشكل متكامل

أركايف للذكاءمنذ 1 شهر
هل تعاني الأنظمة الذكية من هلاوس غير متوقعة؟ اكتشفوا أحدث الحلول في تقييم الأداء!
أبحاث

هل تعاني الأنظمة الذكية من هلاوس غير متوقعة؟ اكتشفوا أحدث الحلول في تقييم الأداء!

أركايف للذكاءمنذ 1 شهر
EgoCoT-Bench: خطوة ثورية في تقييم نماذج الذكاء الاصطناعي لفهم الفيديو من منظور ذاتي!
أبحاث

EgoCoT-Bench: خطوة ثورية في تقييم نماذج الذكاء الاصطناعي لفهم الفيديو من منظور ذاتي!

أركايف للذكاءمنذ 2 شهر
OmniGUI: الثورة الجديدة في تقييم وكالات واجهة المستخدم الرسومية في بيئات الهواتف الذكية!
أبحاث

OmniGUI: الثورة الجديدة في تقييم وكالات واجهة المستخدم الرسومية في بيئات الهواتف الذكية!

أركايف للذكاءمنذ 2 شهر
ابتكار معايير دقيقة لتقييم شامل لنماذج الذكاء الاصطناعي!
أبحاث

ابتكار معايير دقيقة لتقييم شامل لنماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
👁 2
CAM-Bench: ثورة جديدة في قياس الذكاء الاصطناعي في الرياضيات التطبيقية
أبحاث

CAM-Bench: ثورة جديدة في قياس الذكاء الاصطناعي في الرياضيات التطبيقية

أركايف للذكاءمنذ 2 شهر
👁 1
هل معايير تقييم المشفرات التلقائية النادرة موثوقة؟ اكتشف الحقيقة المذهلة!
أبحاث

هل معايير تقييم المشفرات التلقائية النادرة موثوقة؟ اكتشف الحقيقة المذهلة!

أركايف للذكاءمنذ 2 شهر