🏷️ #Benchmarking
15 مقال
أبحاث
إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!
أركايف للذكاءمنذ 2 يوم
👁 1أبحاث
هل يمكن للذكاء الاصطناعي تعلم السياق المتعدد الوسائط؟ اكتشفوا Benchmark CLBench-V المبتكر!
أركايف للذكاءمنذ 2 يوم
أبحاث
اكتشاف المعايير الجديدة: تقييم منصات البحث عن الأشخاص المدعومة بالذكاء الاصطناعي!
أركايف للذكاءمنذ 3 يوم
👁 1أبحاث
اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!
أركايف للذكاءمنذ 9 يوم
👁 1أبحاث
تقديم TReB: معيار شامل لتقييم قدرات التفكير في الجداول لنماذج اللغة الكبيرة!
أركايف للذكاءمنذ 9 يوم
👁 1أبحاث
CFM-Bench: مرجع موحد يغير قواعد المنافسة في نماذج القنوات المتعددة!
أركايف للذكاءمنذ 14 يوم
👁 2أبحاث
هل يمكننا الوثوق بنظرية استجابة العنصر لتقييم الذكاء الاصطناعي؟
أركايف للذكاءمنذ 14 يوم
👁 1أبحاث
1D-Bench: معيار ثوري لتوليد أكواد واجهات المستخدم بصورة تكرارية مع تغذية راجعة بصرية!
أركايف للذكاءمنذ 16 يوم
أبحاث
إطلاق Shift & Drift: معيار جديد لتحدي تخطيط الحركة الذاتية بذكاء!
أركايف للذكاءمنذ 21 يوم
👁 2أبحاث
استكشف A²utoLPBench: معيار الذكاء الاصطناعي الجديد للأمور البرمجية!
أركايف للذكاءمنذ 28 يوم
👁 1أبحاث
تحول جديد في تقييم نماذج الذكاء الاصطناعي: قياس تكامل الأداء المعرفي
أركايف للذكاءمنذ 2 شهر
أبحاث
دليل تحليل الأسباب: معيار مبتكر لتقييم أساليب الاستدلال السببي
أركايف للذكاءمنذ 2 شهر
أبحاث
ميد ماركس: مجموعة معايير مفتوحة لتقييم نماذج اللغة الكبيرة في مجال الطب
أركايف للذكاءمنذ 2 شهر
أدوات
إضافة مادة Benchmaxxer المانعة إلى قائمة المتصدرين في ASR: خطوة ثورية في عالم الذكاء الاصطناعي
هاجينج فيسمنذ 2 شهر
👁 1أبحاث
CausalCompass: ثورة في اكتشاف السبب والنتيجة في سلاسل الزمن!
أركايف للذكاءمنذ 3 شهر
