Ailoxa Logo

🏷️ #تقييم نماذج اللغة

8 مقال

ثورة في تقييم نماذج اللغة: ExecRubrics توفر إطارًا مبتكرًا لتقييم فعّال وشفاف!
أبحاث

ثورة في تقييم نماذج اللغة: ExecRubrics توفر إطارًا مبتكرًا لتقييم فعّال وشفاف!

أركايف للذكاءمنذ 9 يوم
👁 1
من يفكر أفضل يعتمد على الوقت: تصنيف نماذج اللغة الكبيرة وفق الميزانية!
أبحاث

من يفكر أفضل يعتمد على الوقت: تصنيف نماذج اللغة الكبيرة وفق الميزانية!

أركايف للذكاءمنذ 21 يوم
👁 1
تطورات مثيرة في تقييم الذكاء الاصطناعي: كيفية مقارنة نماذج الصحة النفسية بدقة وموضوعية!
أبحاث

تطورات مثيرة في تقييم الذكاء الاصطناعي: كيفية مقارنة نماذج الصحة النفسية بدقة وموضوعية!

أركايف للذكاءمنذ 1 شهر
CARV: معيار تشخيصي جديد لتقييم القدرة على الاستدلال التمثيلي في نماذج اللغة متعددة الوسائط!
أبحاث

CARV: معيار تشخيصي جديد لتقييم القدرة على الاستدلال التمثيلي في نماذج اللغة متعددة الوسائط!

أركايف للذكاءمنذ 1 شهر
👁 1
اختبار متكيف لتقييم نماذج اللغة الكبيرة: بديل سيكومتري لمؤشرات الأداء الثابتة
أبحاث

اختبار متكيف لتقييم نماذج اللغة الكبيرة: بديل سيكومتري لمؤشرات الأداء الثابتة

أركايف للذكاءمنذ 1 شهر
👁 1
التحليل الإحصائي للذكاء الاصطناعي: مكتبة evalci تُحدث ثورة في تقييم نماذج اللغة
أبحاث

التحليل الإحصائي للذكاء الاصطناعي: مكتبة evalci تُحدث ثورة في تقييم نماذج اللغة

أركايف للذكاءمنذ 1 شهر
من الذي انحرف: النظام أم القاضي؟ كشف النقاب عن تفاصيل جديدة في تقييم نماذج اللغة الضخمة
أبحاث

من الذي انحرف: النظام أم القاضي؟ كشف النقاب عن تفاصيل جديدة في تقييم نماذج اللغة الضخمة

أركايف للذكاءمنذ 2 شهر
اكتشاف أبعاد جديدة في تقييم نماذج لغات الذكاء الاصطناعي مع Omanic!
أبحاث

اكتشاف أبعاد جديدة في تقييم نماذج لغات الذكاء الاصطناعي مع Omanic!

أركايف للذكاءمنذ 3 شهر