Ailoxa Logo

🏷️ #Evaluation

9 مقال

تقييم المقيمين: كيف يمكن لنظرية قياس راش تحسين تقييم نماذج اللغات الضخمة؟
نماذج لغوية

تقييم المقيمين: كيف يمكن لنظرية قياس راش تحسين تقييم نماذج اللغات الضخمة؟

أركايف للذكاءمنذ 10 يوم
👁 1
اختراق تقني جديد: تقييم دقة أدوات الذاكرة في نماذج اللغة الضخمة
أبحاث

اختراق تقني جديد: تقييم دقة أدوات الذاكرة في نماذج اللغة الضخمة

أركايف للذكاءمنذ 16 يوم
👁 1
SkillNet: ثورة في خلق وتقييم مهارات الذكاء الاصطناعي!
أدوات

SkillNet: ثورة في خلق وتقييم مهارات الذكاء الاصطناعي!

أركايف للذكاءمنذ 24 يوم
👁 1
جسراً لتقويم الفجوات: معايير موحدة للبحث متعدد الأهداف
أبحاث

جسراً لتقويم الفجوات: معايير موحدة للبحث متعدد الأهداف

أركايف للذكاءمنذ 1 شهر
👁 2
اكتشافات ثورية في تقييم نماذج الذكاء الاصطناعي: تعرف على BayesAME!
أبحاث

اكتشافات ثورية في تقييم نماذج الذكاء الاصطناعي: تعرف على BayesAME!

أركايف للذكاءمنذ 1 شهر
تحولات مذهلة في نماذج الذكاء الاصطناعي: DynamicRubric يعيد تشكيل كيفية تحسين الأداء
أبحاث

تحولات مذهلة في نماذج الذكاء الاصطناعي: DynamicRubric يعيد تشكيل كيفية تحسين الأداء

أركايف للذكاءمنذ 1 شهر
👁 1
ثورة في تقييم الوكلاء المحادثيين: نظام مبتكر للتقييم متعدد الأبعاد يعيد تشكيل التجربة التجارية!
أبحاث

ثورة في تقييم الوكلاء المحادثيين: نظام مبتكر للتقييم متعدد الأبعاد يعيد تشكيل التجربة التجارية!

أركايف للذكاءمنذ 2 شهر
👁 3
ORCA: تقييم دقة استجابات النماذج اللغوية المخصصة للسؤال والجواب الصوتي
أبحاث

ORCA: تقييم دقة استجابات النماذج اللغوية المخصصة للسؤال والجواب الصوتي

أركايف للذكاءمنذ 2 شهر
MM-JudgeBias: معيار أساسي لتحليل تحيزات نماذج اللغة الكبيرة المتعددة الوسائط
أبحاث

MM-JudgeBias: معيار أساسي لتحليل تحيزات نماذج اللغة الكبيرة المتعددة الوسائط

أركايف للذكاءمنذ 4 شهر
👁 2