🏷️ #تقييم الذكاء الاصطناعي
95 مقال
أبحاث
تكنولوجيا جديدة تعزز دقة تقييم الذكاء الاصطناعي: تقنيات مبتكرة نحو محاكاة واقعية!
أركايف للذكاءمنذ 18 ساعة
أبحاث
RENDER: السيطرة على تقييم الذاكرة في نماذج اللغات الضخمة!
أركايف للذكاءمنذ 8 يوم
👁 1أبحاث
تقييم نماذج اللغات الضخمة: خارطة طريق مبتكرة نحو الفهم العميق
أركايف للذكاءمنذ 9 يوم
أبحاث
إطلاق TELEVAL: معيار جديد لتقييم نماذج اللغة المحكية في السيناريوهات التفاعلية الصينية
أركايف للذكاءمنذ 9 يوم
👁 3أبحاث
لا حكم بدون سبب: تطوير نظام تقييم الذكاء الاصطناعي القائم على المقاييس المضادة
أركايف للذكاءمنذ 10 يوم
👁 1أبحاث
اكتشاف ثوري في تقييم نماذج اللغات الضخمة: Qworld ينقل معايير التقييم إلى آفاق جديدة!
أركايف للذكاءمنذ 13 يوم
👁 1نماذج لغوية
هل تحدث ثورة في عالم نماذج اللغات؟ تعرفوا على RepBench لقياس القدرات بدقة مذهلة!
أركايف للذكاءمنذ 17 يوم
أبحاث
تسوغو: خطوة ثورية في تقييم كفاءة البحث في نماذج الذكاء الاصطناعي من خلال تحديات الحياة والموت في لعبة Go
أركايف للذكاءمنذ 20 يوم
👁 2أبحاث
تقييم فعالية القواعد الناتجة عن نماذج اللغات الضخمة في الأمن السيبراني
أركايف للذكاءمنذ 21 يوم
أبحاث
دراسة جديدة تكشف مفاجآت حول دقة نماذج الذكاء الاصطناعي وتأثير ترتيب الخيارات!
أركايف للذكاءمنذ 21 يوم
أبحاث
ثورة الذكاء الاصطناعي: الكشف عن Apodex Discovery لتقييم التكنولوجيا المتقدمة!
أركايف للذكاءمنذ 21 يوم
أبحاث
خطوة نحو معيار حقوق الإنسان لنماذج اللغات الضخمة: منهجية مبتكرة للتقييم
أركايف للذكاءمنذ 22 يوم
أبحاث
Autorubric: الإطار الثوري لتقييم نماذج الذكاء الاصطناعي في المهام غير القابلة للتحقق
أركايف للذكاءمنذ 23 يوم
👁 2أبحاث
تحديات الزمن: مقارنة نماذج اللغة الضخمة في فهم الوثائق المتطورة
أركايف للذكاءمنذ 23 يوم
👁 3أبحاث
ثورة في تقييم الذكاء الاصطناعي: لماذا يجب قياس تكلفة التحقق بدلاً من الدقة فقط؟
أركايف للذكاءمنذ 23 يوم
أدوات
تقديم المحرك الشامل لتدقيق الوكلاء: الأداة الثورية لتقييم نماذج الذكاء الاصطناعي!
أركايف للذكاءمنذ 24 يوم
👁 2أبحاث
ثورة الذكاء الاصطناعي في البحث العلمي: خطوة جديدة نحو الاكتشافات الحقيقية!
أركايف للذكاءمنذ 24 يوم
👁 1أبحاث
إطلاق M3MAD-Bench: معيار ثوري لتقييم مناظرات الذكاء الاصطناعي عبر مجالات متعددة!
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
فخ الشكلية: هل تُعمي أنظمة LLM-as-a-Judge عن الحقيقة تحت ضغط التوافق الاجتماعي؟
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
تقنية جديدة في تحسين التفضيلات: نموذج DMAPO يدعو لتقليل البيانات وزيادة الدقة
أركايف للذكاءمنذ 1 شهر
👁 11 / 5التالي →
