🏷️ #تقييم الأداء
167 مقال
أبحاث
K-MetBench: الإطار الثوري لتقييم الذكاء الاصطناعي في التنبؤات الجوية الكورية!
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة في تقنيات الذكاء الاصطناعي: تقييم CUDA Tile لبناء الأنوية على معالجات NVIDIA
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
ProEval: إطار مبتكر لاكتشاف الأخطاء وتحسين تقييم الأداء في نماذج الذكاء الاصطناعي التوليدي
أركايف للذكاءمنذ 2 شهر
أبحاث
استكشاف التخطيط البصري في نماذج تحرير الصور: ثورة جديدة في الذكاء الاصطناعي!
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة تقييم الأداء: إطار مبتكر لتحديد إخفاقات الوكلاء الثلاثي اللغة في الفضاء العام
أركايف للذكاءمنذ 2 شهر
أبحاث
BLAST: ثورة جديدة في تقييم نماذج اللغة الكبيرة باستخدام برمجة مجموعات الإجابة
أركايف للذكاءمنذ 2 شهر
نماذج لغوية
أهم 7 معايير تُعبر عن أداء التفكير الوكيل في نماذج اللغات الضخمة
مارك تيك بوستمنذ 2 شهر
أبحاث
تحقيق الثقة في التقييم: كيف تساهم الطبقات الدلالية في تحسين استرجاع المعلومات!
أركايف للذكاءمنذ 3 شهر
أبحاث
مستقبل الذكاء الاصطناعي في المنازل الذكية: تقييم أداء الأنظمة الشخصي عبر PersonalHomeBench!
أركايف للذكاءمنذ 3 شهر
أبحاث
هل تعرف النماذج اللغوية الصغيرة متى تكون مخطئة؟ دراسة جديدة في تقييم الأداء التعليمي
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
هل تحتل نماذج اللغات الضخمة (LLMs) زمام المبادرة في حل المشكلات المنطقية؟ كفاءة صياغة الاستدلالات أم مجرد خدع؟
أركايف للذكاءمنذ 3 شهر
أبحاث
اكتشاف الأبطال: كيف تحدد أفضل وكيل للألعاب العامة بكفاءة مذهلة!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
اختراقات جديدة في عالم الذكاء الاصطناعي: تقييم نماذج اللغة الكبيرة عبر شبكات البيانات!
أركايف للذكاءمنذ 3 شهر
أبحاث
إطلاق XpertBench: معيار جديد لتقييم الذكاء الاصطناعي بمستوى الخبراء!
أركايف للذكاءمنذ 3 شهر
أبحاث
إطلالة جديدة على تقييم استرجاع المعلومات: إطار RARE يواجه التحديات الحقيقية!
أركايف للذكاءمنذ 3 شهر
أبحاث
فحص الأداء المالي: منصة جديدة لتقييم نماذج الذكاء الاصطناعي في الهند
أركايف للذكاءمنذ 3 شهر
أبحاث
GTA-2: ثورة في تقييم وكلاء الأدوات العامة نحو تحقيق كفاءة غير مسبوقة
أركايف للذكاءمنذ 3 شهر
أبحاث
سباق الوكلاء الرائع: تقدمات متقدمة وأخطاء في التنقل!
أركايف للذكاءمنذ 3 شهر
أبحاث
إعادة تعريف العدالة: تقييم شامل لنماذج اللغات الضخمة في فهم النصوص القانونية الفيتنامية
أركايف للذكاءمنذ 3 شهر
أبحاث
ثورة الذكاء الاصطناعي: معيار جديد لتقييم الأعمال الحقلية بفضل FieldWorkArena!
أركايف للذكاءمنذ 3 شهر
👁 1