Ailoxa Logo

🏷️ #تقييم الأداء

167 مقال

K-MetBench: الإطار الثوري لتقييم الذكاء الاصطناعي في التنبؤات الجوية الكورية!
أبحاث

K-MetBench: الإطار الثوري لتقييم الذكاء الاصطناعي في التنبؤات الجوية الكورية!

أركايف للذكاءمنذ 2 شهر
ثورة في تقنيات الذكاء الاصطناعي: تقييم CUDA Tile لبناء الأنوية على معالجات NVIDIA
أبحاث

ثورة في تقنيات الذكاء الاصطناعي: تقييم CUDA Tile لبناء الأنوية على معالجات NVIDIA

أركايف للذكاءمنذ 2 شهر
👁 1
ProEval: إطار مبتكر لاكتشاف الأخطاء وتحسين تقييم الأداء في نماذج الذكاء الاصطناعي التوليدي
أبحاث

ProEval: إطار مبتكر لاكتشاف الأخطاء وتحسين تقييم الأداء في نماذج الذكاء الاصطناعي التوليدي

أركايف للذكاءمنذ 2 شهر
استكشاف التخطيط البصري في نماذج تحرير الصور: ثورة جديدة في الذكاء الاصطناعي!
أبحاث

استكشاف التخطيط البصري في نماذج تحرير الصور: ثورة جديدة في الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
ثورة تقييم الأداء: إطار مبتكر لتحديد إخفاقات الوكلاء الثلاثي اللغة في الفضاء العام
أبحاث

ثورة تقييم الأداء: إطار مبتكر لتحديد إخفاقات الوكلاء الثلاثي اللغة في الفضاء العام

أركايف للذكاءمنذ 2 شهر
BLAST: ثورة جديدة في تقييم نماذج اللغة الكبيرة باستخدام برمجة مجموعات الإجابة
أبحاث

BLAST: ثورة جديدة في تقييم نماذج اللغة الكبيرة باستخدام برمجة مجموعات الإجابة

أركايف للذكاءمنذ 2 شهر
أهم 7 معايير تُعبر عن أداء التفكير الوكيل في نماذج اللغات الضخمة
نماذج لغوية

أهم 7 معايير تُعبر عن أداء التفكير الوكيل في نماذج اللغات الضخمة

مارك تيك بوستمنذ 2 شهر
تحقيق الثقة في التقييم: كيف تساهم الطبقات الدلالية في تحسين استرجاع المعلومات!
أبحاث

تحقيق الثقة في التقييم: كيف تساهم الطبقات الدلالية في تحسين استرجاع المعلومات!

أركايف للذكاءمنذ 3 شهر
مستقبل الذكاء الاصطناعي في المنازل الذكية: تقييم أداء الأنظمة الشخصي عبر PersonalHomeBench!
أبحاث

مستقبل الذكاء الاصطناعي في المنازل الذكية: تقييم أداء الأنظمة الشخصي عبر PersonalHomeBench!

أركايف للذكاءمنذ 3 شهر
هل تعرف النماذج اللغوية الصغيرة متى تكون مخطئة؟ دراسة جديدة في تقييم الأداء التعليمي
أبحاث

هل تعرف النماذج اللغوية الصغيرة متى تكون مخطئة؟ دراسة جديدة في تقييم الأداء التعليمي

أركايف للذكاءمنذ 3 شهر
👁 1
هل تحتل نماذج اللغات الضخمة (LLMs) زمام المبادرة في حل المشكلات المنطقية؟ كفاءة صياغة الاستدلالات أم مجرد خدع؟
أبحاث

هل تحتل نماذج اللغات الضخمة (LLMs) زمام المبادرة في حل المشكلات المنطقية؟ كفاءة صياغة الاستدلالات أم مجرد خدع؟

أركايف للذكاءمنذ 3 شهر
اكتشاف الأبطال: كيف تحدد أفضل وكيل للألعاب العامة بكفاءة مذهلة!
أبحاث

اكتشاف الأبطال: كيف تحدد أفضل وكيل للألعاب العامة بكفاءة مذهلة!

أركايف للذكاءمنذ 3 شهر
👁 1
اختراقات جديدة في عالم الذكاء الاصطناعي: تقييم نماذج اللغة الكبيرة عبر شبكات البيانات!
أبحاث

اختراقات جديدة في عالم الذكاء الاصطناعي: تقييم نماذج اللغة الكبيرة عبر شبكات البيانات!

أركايف للذكاءمنذ 3 شهر
إطلاق XpertBench: معيار جديد لتقييم الذكاء الاصطناعي بمستوى الخبراء!
أبحاث

إطلاق XpertBench: معيار جديد لتقييم الذكاء الاصطناعي بمستوى الخبراء!

أركايف للذكاءمنذ 3 شهر
إطلالة جديدة على تقييم استرجاع المعلومات: إطار RARE يواجه التحديات الحقيقية!
أبحاث

إطلالة جديدة على تقييم استرجاع المعلومات: إطار RARE يواجه التحديات الحقيقية!

أركايف للذكاءمنذ 3 شهر
فحص الأداء المالي: منصة جديدة لتقييم نماذج الذكاء الاصطناعي في الهند
أبحاث

فحص الأداء المالي: منصة جديدة لتقييم نماذج الذكاء الاصطناعي في الهند

أركايف للذكاءمنذ 3 شهر
GTA-2: ثورة في تقييم وكلاء الأدوات العامة نحو تحقيق كفاءة غير مسبوقة
أبحاث

GTA-2: ثورة في تقييم وكلاء الأدوات العامة نحو تحقيق كفاءة غير مسبوقة

أركايف للذكاءمنذ 3 شهر
سباق الوكلاء الرائع: تقدمات متقدمة وأخطاء في التنقل!
أبحاث

سباق الوكلاء الرائع: تقدمات متقدمة وأخطاء في التنقل!

أركايف للذكاءمنذ 3 شهر
إعادة تعريف العدالة: تقييم شامل لنماذج اللغات الضخمة في فهم النصوص القانونية الفيتنامية
أبحاث

إعادة تعريف العدالة: تقييم شامل لنماذج اللغات الضخمة في فهم النصوص القانونية الفيتنامية

أركايف للذكاءمنذ 3 شهر
ثورة الذكاء الاصطناعي: معيار جديد لتقييم الأعمال الحقلية بفضل FieldWorkArena!
أبحاث

ثورة الذكاء الاصطناعي: معيار جديد لتقييم الأعمال الحقلية بفضل FieldWorkArena!

أركايف للذكاءمنذ 3 شهر
👁 1