Ailoxa Logo

🏷️ #تقييم

275 مقال

طرق مبتكرة لتقدير التصنيفات: شروط تطبيق منهجية التقييم الحُكمية
أبحاث

طرق مبتكرة لتقدير التصنيفات: شروط تطبيق منهجية التقييم الحُكمية

أركايف للذكاءمنذ 2 شهر
ثورة التصميم: تقييم نماذج Text-to-CAD بكل سهولة وفاعلية!
أبحاث

ثورة التصميم: تقييم نماذج Text-to-CAD بكل سهولة وفاعلية!

أركايف للذكاءمنذ 2 شهر
إطار عمل مبتكر لتقييم نماذج اللغات الضخمة: دقة وسرعة بلا حدود!
أبحاث

إطار عمل مبتكر لتقييم نماذج اللغات الضخمة: دقة وسرعة بلا حدود!

أركايف للذكاءمنذ 2 شهر
ثورة التعلم المعزز: كيف تُحسن المعايير المهيكلة من نتائج الذكاء الاصطناعي
أبحاث

ثورة التعلم المعزز: كيف تُحسن المعايير المهيكلة من نتائج الذكاء الاصطناعي

أركايف للذكاءمنذ 2 شهر
اختبار أداء الوكلاء: AgentEscapeBench يكشف تحديات التفكير المستند إلى الأدوات في نماذج اللغة
أبحاث

اختبار أداء الوكلاء: AgentEscapeBench يكشف تحديات التفكير المستند إلى الأدوات في نماذج اللغة

أركايف للذكاءمنذ 2 شهر
ثورة في تدقيق أنظمة الذكاء الاصطناعي: ضمانات جديدة وآمنة
أبحاث

ثورة في تدقيق أنظمة الذكاء الاصطناعي: ضمانات جديدة وآمنة

أركايف للذكاءمنذ 2 شهر
DRIP-R: معيار مبتكر لتقييم اتخاذ القرارات تحت غموض السياسات في مجال التجزئة!
أبحاث

DRIP-R: معيار مبتكر لتقييم اتخاذ القرارات تحت غموض السياسات في مجال التجزئة!

أركايف للذكاءمنذ 2 شهر
البحث الجديد يكشف خفايا ضريبة الترجمة في التقييمات متعددة اللغات: إمكانيات غير متوقعة!
أبحاث

البحث الجديد يكشف خفايا ضريبة الترجمة في التقييمات متعددة اللغات: إمكانيات غير متوقعة!

أركايف للذكاءمنذ 2 شهر
اختبار نماذج العالم: ثورة في تقييم الذكاء الاصطناعي بطرق جديدة!
أبحاث

اختبار نماذج العالم: ثورة في تقييم الذكاء الاصطناعي بطرق جديدة!

أركايف للذكاءمنذ 2 شهر
SCRuB: ثورة في تقييم تفكير النماذج اللغوية حول المفاهيم الاجتماعية
أبحاث

SCRuB: ثورة في تقييم تفكير النماذج اللغوية حول المفاهيم الاجتماعية

أركايف للذكاءمنذ 2 شهر
تحقيق الدقة في الاستنتاجات متعددة الوسائط: نموذج MuRGAt لنماذج اللغة القوية
أبحاث

تحقيق الدقة في الاستنتاجات متعددة الوسائط: نموذج MuRGAt لنماذج اللغة القوية

أركايف للذكاءمنذ 2 شهر
تحدي تقييم أمان نماذج اللغة: كيف يمكن مقارنة النماذج بدون مؤشرات معيارية؟
أبحاث

تحدي تقييم أمان نماذج اللغة: كيف يمكن مقارنة النماذج بدون مؤشرات معيارية؟

أركايف للذكاءمنذ 2 شهر
👁 1
ثورة التفكير النقدي: كيف يقيم الذكاء الاصطناعي والحكم البشري الحجج المضادة؟
أبحاث

ثورة التفكير النقدي: كيف يقيم الذكاء الاصطناعي والحكم البشري الحجج المضادة؟

أركايف للذكاءمنذ 2 شهر
تجاوز المعايير الثابتة: تقييم حدود ديناميكي لنماذج اللغة لتحسين القدرات
أبحاث

تجاوز المعايير الثابتة: تقييم حدود ديناميكي لنماذج اللغة لتحسين القدرات

أركايف للذكاءمنذ 2 شهر
AirQualityBench: معيار تقييم واقعي للforecasting جودة الهواء العالمية!
أبحاث

AirQualityBench: معيار تقييم واقعي للforecasting جودة الهواء العالمية!

أركايف للذكاءمنذ 2 شهر
تقييم الأنظمة المستقلة في الوقت الحقيقي تحت هجمات معادية: كيف نحقق الأمان في القيادة الذاتية؟
أبحاث

تقييم الأنظمة المستقلة في الوقت الحقيقي تحت هجمات معادية: كيف نحقق الأمان في القيادة الذاتية؟

أركايف للذكاءمنذ 2 شهر
إطلاق CreativityBench: معيار جديد لتقييم الإبداع في الذكاء الاصطناعي من خلال إعادة استخدام الأدوات!
أبحاث

إطلاق CreativityBench: معيار جديد لتقييم الإبداع في الذكاء الاصطناعي من خلال إعادة استخدام الأدوات!

أركايف للذكاءمنذ 2 شهر
👁 1
RoboEval: ثورة في تقييم الأداء الروبوتي من خلال مقاييس شاملة ومباشرة
روبوتات

RoboEval: ثورة في تقييم الأداء الروبوتي من خلال مقاييس شاملة ومباشرة

أركايف للذكاءمنذ 2 شهر
iWorld-Bench: المنصة الثورية لتقييم نماذج العالم التفاعلية في الذكاء الاصطناعي!
أبحاث

iWorld-Bench: المنصة الثورية لتقييم نماذج العالم التفاعلية في الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
👁 1
MCJudgeBench: الثورية في تقييم القضاة على مستوى القيود في تنفيذ التعليمات المتعددة!
أبحاث

MCJudgeBench: الثورية في تقييم القضاة على مستوى القيود في تنفيذ التعليمات المتعددة!

أركايف للذكاءمنذ 2 شهر
👁 2