Ailoxa Logo

🏷️ #معايير التقييم

19 مقال

إطلاق FrontierChallenge: تحدي جديد يقيم إكمال سير العمل العلمي
أبحاث

إطلاق FrontierChallenge: تحدي جديد يقيم إكمال سير العمل العلمي

أركايف للذكاءمنذ 2 يوم
👁 1
SWE-Bench Pro Verified: معيار موثوق لتقييم وكلاء هندسة البرمجيات!
أبحاث

SWE-Bench Pro Verified: معيار موثوق لتقييم وكلاء هندسة البرمجيات!

أركايف للذكاءمنذ 3 يوم
DAREBench: معيار جديد لتقييم نماذج الذكاء الاصطناعي كعملاء في بيئات حقيقية
أبحاث

DAREBench: معيار جديد لتقييم نماذج الذكاء الاصطناعي كعملاء في بيئات حقيقية

أركايف للذكاءمنذ 3 يوم
👁 1
دومايت بينش: تقييم الوكلاء المستقلين في ورش العمل المعقدة الواقعية
أبحاث

دومايت بينش: تقييم الوكلاء المستقلين في ورش العمل المعقدة الواقعية

أركايف للذكاءمنذ 16 يوم
👁 1
اكتشاف ثوري في تقييم نماذج اللغات الضخمة: Qworld ينقل معايير التقييم إلى آفاق جديدة!
أبحاث

اكتشاف ثوري في تقييم نماذج اللغات الضخمة: Qworld ينقل معايير التقييم إلى آفاق جديدة!

أركايف للذكاءمنذ 23 يوم
👁 1
VAKRA: ثورة في تقييم التفكير المعقد عبر واجهات برمجة التطبيقات (APIs) والسياسات
أبحاث

VAKRA: ثورة في تقييم التفكير المعقد عبر واجهات برمجة التطبيقات (APIs) والسياسات

أركايف للذكاءمنذ 1 شهر
👁 1
تحدي الأمن السيبراني: تقديم معيار جديد للمراجعة العكسية بدون تلوث!
أبحاث

تحدي الأمن السيبراني: تقديم معيار جديد للمراجعة العكسية بدون تلوث!

أركايف للذكاءمنذ 1 شهر
هل تستطيع معايير التقييم كشف الأخطاء في ترجمات الصينية الكلاسيكية إلى الإنجليزية؟
أبحاث

هل تستطيع معايير التقييم كشف الأخطاء في ترجمات الصينية الكلاسيكية إلى الإنجليزية؟

أركايف للذكاءمنذ 1 شهر
👁 2
CAP: معيار جديد لتقييم وكلاء المتصفح مع تفاعلات معقدة وإدراك بصري!
أبحاث

CAP: معيار جديد لتقييم وكلاء المتصفح مع تفاعلات معقدة وإدراك بصري!

أركايف للذكاءمنذ 1 شهر
👁 2
FinRank: معيار جديد لتحسين الإجابة عن الأسئلة المالية مع التركيز على الدلائل الصحيحة!
أبحاث

FinRank: معيار جديد لتحسين الإجابة عن الأسئلة المالية مع التركيز على الدلائل الصحيحة!

أركايف للذكاءمنذ 1 شهر
نحو مستقبل تقييم المقالات: كيف تغير نماذج الذكاء الاصطناعي اللعبة باستخدام التعلم التعزيزي
نماذج لغوية

نحو مستقبل تقييم المقالات: كيف تغير نماذج الذكاء الاصطناعي اللعبة باستخدام التعلم التعزيزي

أركايف للذكاءمنذ 1 شهر
👁 2
تطورات مذهلة في تصميم وكلاء الإثبات الذاتية: كيف يمكن للذكاء الاصطناعي إعادة كتابة نفسه!
أبحاث

تطورات مذهلة في تصميم وكلاء الإثبات الذاتية: كيف يمكن للذكاء الاصطناعي إعادة كتابة نفسه!

أركايف للذكاءمنذ 1 شهر
👁 1
ثورة جديدة في تقنيات التشفير: فك شفرة الحد الأدنى من خطر بايز باستخدام قنوات مضطربة!
أبحاث

ثورة جديدة في تقنيات التشفير: فك شفرة الحد الأدنى من خطر بايز باستخدام قنوات مضطربة!

أركايف للذكاءمنذ 2 شهر
كيف تعزز التفسير البعدي أفكار إثبات المعرفة لرسوم المعلومات؟
أبحاث

كيف تعزز التفسير البعدي أفكار إثبات المعرفة لرسوم المعلومات؟

أركايف للذكاءمنذ 2 شهر
هل تقييم الذكاء الاصطناعي يمكن أن يؤثر على انطباعاتنا؟ أهمية السياق في تفسير الكتابات الأكاديمية!
أبحاث

هل تقييم الذكاء الاصطناعي يمكن أن يؤثر على انطباعاتنا؟ أهمية السياق في تفسير الكتابات الأكاديمية!

أركايف للذكاءمنذ 3 شهر
هل نحقق تقدمًا حقيقيًا في تعميم المجالات متعددة الأنماط؟ دراسة شاملة تكشف الحقائق
أبحاث

هل نحقق تقدمًا حقيقيًا في تعميم المجالات متعددة الأنماط؟ دراسة شاملة تكشف الحقائق

أركايف للذكاءمنذ 4 شهر
استكشاف الإنترنت لإنشاء معايير تحدي مبتكرة: ثورة في تقييم النماذج الذكية
أبحاث

استكشاف الإنترنت لإنشاء معايير تحدي مبتكرة: ثورة في تقييم النماذج الذكية

أركايف للذكاءمنذ 4 شهر
👁 1
اكتشف كيف يُحدث AdaRubric ثورة في تقييم وكالات الذكاء الاصطناعي!
أبحاث

اكتشف كيف يُحدث AdaRubric ثورة في تقييم وكالات الذكاء الاصطناعي!

أركايف للذكاءمنذ 4 شهر
👁 2
DABStep: معيار تقييم الوكلاء الذكيين في التفكير المتعدد الخطوات!
أبحاث

DABStep: معيار تقييم الوكلاء الذكيين في التفكير المتعدد الخطوات!

هاجينج فيسمنذ 19 شهر
👁 1