Ailoxa Logo

🏷️ #Benchmarking

15 مقال

إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!
أبحاث

إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!

أركايف للذكاءمنذ 2 يوم
👁 1
هل يمكن للذكاء الاصطناعي تعلم السياق المتعدد الوسائط؟ اكتشفوا Benchmark CLBench-V المبتكر!
أبحاث

هل يمكن للذكاء الاصطناعي تعلم السياق المتعدد الوسائط؟ اكتشفوا Benchmark CLBench-V المبتكر!

أركايف للذكاءمنذ 2 يوم
اكتشاف المعايير الجديدة: تقييم منصات البحث عن الأشخاص المدعومة بالذكاء الاصطناعي!
أبحاث

اكتشاف المعايير الجديدة: تقييم منصات البحث عن الأشخاص المدعومة بالذكاء الاصطناعي!

أركايف للذكاءمنذ 3 يوم
👁 1
اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!
أبحاث

اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!

أركايف للذكاءمنذ 9 يوم
👁 1
تقديم TReB: معيار شامل لتقييم قدرات التفكير في الجداول لنماذج اللغة الكبيرة!
أبحاث

تقديم TReB: معيار شامل لتقييم قدرات التفكير في الجداول لنماذج اللغة الكبيرة!

أركايف للذكاءمنذ 9 يوم
👁 1
CFM-Bench: مرجع موحد يغير قواعد المنافسة في نماذج القنوات المتعددة!
أبحاث

CFM-Bench: مرجع موحد يغير قواعد المنافسة في نماذج القنوات المتعددة!

أركايف للذكاءمنذ 14 يوم
👁 2
هل يمكننا الوثوق بنظرية استجابة العنصر لتقييم الذكاء الاصطناعي؟
أبحاث

هل يمكننا الوثوق بنظرية استجابة العنصر لتقييم الذكاء الاصطناعي؟

أركايف للذكاءمنذ 14 يوم
👁 1
1D-Bench: معيار ثوري لتوليد أكواد واجهات المستخدم بصورة تكرارية مع تغذية راجعة بصرية!
أبحاث

1D-Bench: معيار ثوري لتوليد أكواد واجهات المستخدم بصورة تكرارية مع تغذية راجعة بصرية!

أركايف للذكاءمنذ 16 يوم
إطلاق Shift & Drift: معيار جديد لتحدي تخطيط الحركة الذاتية بذكاء!
أبحاث

إطلاق Shift & Drift: معيار جديد لتحدي تخطيط الحركة الذاتية بذكاء!

أركايف للذكاءمنذ 21 يوم
👁 2
استكشف A²utoLPBench: معيار الذكاء الاصطناعي الجديد للأمور البرمجية!
أبحاث

استكشف A²utoLPBench: معيار الذكاء الاصطناعي الجديد للأمور البرمجية!

أركايف للذكاءمنذ 28 يوم
👁 1
تحول جديد في تقييم نماذج الذكاء الاصطناعي: قياس تكامل الأداء المعرفي
أبحاث

تحول جديد في تقييم نماذج الذكاء الاصطناعي: قياس تكامل الأداء المعرفي

أركايف للذكاءمنذ 2 شهر
دليل تحليل الأسباب: معيار مبتكر لتقييم أساليب الاستدلال السببي
أبحاث

دليل تحليل الأسباب: معيار مبتكر لتقييم أساليب الاستدلال السببي

أركايف للذكاءمنذ 2 شهر
ميد ماركس: مجموعة معايير مفتوحة لتقييم نماذج اللغة الكبيرة في مجال الطب
أبحاث

ميد ماركس: مجموعة معايير مفتوحة لتقييم نماذج اللغة الكبيرة في مجال الطب

أركايف للذكاءمنذ 2 شهر
إضافة مادة Benchmaxxer المانعة إلى قائمة المتصدرين في ASR: خطوة ثورية في عالم الذكاء الاصطناعي
أدوات

إضافة مادة Benchmaxxer المانعة إلى قائمة المتصدرين في ASR: خطوة ثورية في عالم الذكاء الاصطناعي

هاجينج فيسمنذ 2 شهر
👁 1
CausalCompass: ثورة في اكتشاف السبب والنتيجة في سلاسل الزمن!
أبحاث

CausalCompass: ثورة في اكتشاف السبب والنتيجة في سلاسل الزمن!

أركايف للذكاءمنذ 3 شهر