Ailoxa Logo

🏷️ #تقييم

379 مقال

EduClaw-Bench: ثورة في تقييم قدرات وكلاء التعليم الذكي!
أبحاث

EduClaw-Bench: ثورة في تقييم قدرات وكلاء التعليم الذكي!

أركايف للذكاءمنذ 1 شهر
اكتشف KnowHal: معيار ثوري لتقييم الهلوسة المتعددة الأبعاد في نماذج الذكاء الاصطناعي!
أبحاث

اكتشف KnowHal: معيار ثوري لتقييم الهلوسة المتعددة الأبعاد في نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر
اختبار سقراط: ثورة في تقييم المعرفة من خلال المحادثات الديناميكية المتعددة الأبعاد
أبحاث

اختبار سقراط: ثورة في تقييم المعرفة من خلال المحادثات الديناميكية المتعددة الأبعاد

أركايف للذكاءمنذ 1 شهر
👁 1
ثورة في تقييم نماذج اللغة: لماذا يجب أن نتوقف عن الاعتماد على المتوسطات التقليدية؟
أبحاث

ثورة في تقييم نماذج اللغة: لماذا يجب أن نتوقف عن الاعتماد على المتوسطات التقليدية؟

أركايف للذكاءمنذ 1 شهر
👁 1
تجربة تفاعلية جديدة: نظام تقييم المحاكاة الشخصي للروبوتات التفاعلية!
روبوتات

تجربة تفاعلية جديدة: نظام تقييم المحاكاة الشخصي للروبوتات التفاعلية!

أركايف للذكاءمنذ 1 شهر
الثورة في تقييم نماذج الذكاء الاصطناعي: إطلاق ModelEquivBench لتحسين دقة التقييم
أدوات

الثورة في تقييم نماذج الذكاء الاصطناعي: إطلاق ModelEquivBench لتحسين دقة التقييم

أركايف للذكاءمنذ 1 شهر
👁 1
اكتشف ForgetBench: ثورة في تقييم ديناميكيات النسيان في نماذج اللغة
نماذج لغوية

اكتشف ForgetBench: ثورة في تقييم ديناميكيات النسيان في نماذج اللغة

أركايف للذكاءمنذ 1 شهر
👁 2
هل يمكن أن تصدق تقييمات الذكاء الاصطناعي؟ الكشف عن أزمة تقييم جديدة!
أبحاث

هل يمكن أن تصدق تقييمات الذكاء الاصطناعي؟ الكشف عن أزمة تقييم جديدة!

أركايف للذكاءمنذ 1 شهر
👁 1
هام: هامش القوة المقاومة لنماذج الأمراض: كيفية تعزيز دقتها في التشخيص!
أبحاث

هام: هامش القوة المقاومة لنماذج الأمراض: كيفية تعزيز دقتها في التشخيص!

أركايف للذكاءمنذ 1 شهر
👁 1
GAUGE: ثورة في تقييم النماذج المالية المعتمدة على الذكاء الاصطناعي!
أبحاث

GAUGE: ثورة في تقييم النماذج المالية المعتمدة على الذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر
LU-500: المعيار الرائد لفهم مفاهيم إزالة الشعارات
أبحاث

LU-500: المعيار الرائد لفهم مفاهيم إزالة الشعارات

أركايف للذكاءمنذ 1 شهر
👁 2
استكشاف ثورة الذكاء الاصطناعي في الطب: كيف يتفوق نموذج DR. INFO على بنوك المعرفة التقليدية!
أبحاث

استكشاف ثورة الذكاء الاصطناعي في الطب: كيف يتفوق نموذج DR. INFO على بنوك المعرفة التقليدية!

أركايف للذكاءمنذ 1 شهر
VlogReward: ثورة في تقييم تعديل الفلوغات عبر نماذج الذكاء الاصطناعي!
أدوات

VlogReward: ثورة في تقييم تعديل الفلوغات عبر نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر
👁 1
إطلاق ADAGE: الابتكار الجديد في تقييم التفكير المجازي عبر اللغات
أبحاث

إطلاق ADAGE: الابتكار الجديد في تقييم التفكير المجازي عبر اللغات

أركايف للذكاءمنذ 1 شهر
👁 1
استكشاف ثوري في تقويم الأسئلة باستخدام نماذج لغوية محكمة!
أبحاث

استكشاف ثوري في تقويم الأسئلة باستخدام نماذج لغوية محكمة!

أركايف للذكاءمنذ 1 شهر
تأثير السقالات في تقييم وكلاء البرمجة: استغلال الاختيار كمتغير خفي
أبحاث

تأثير السقالات في تقييم وكلاء البرمجة: استغلال الاختيار كمتغير خفي

أركايف للذكاءمنذ 1 شهر
👁 1
سكي إكسبلور: تطور معايير تقييم الوكلاء المستقلين في البحث العلمي
أبحاث

سكي إكسبلور: تطور معايير تقييم الوكلاء المستقلين في البحث العلمي

أركايف للذكاءمنذ 1 شهر
👁 3
ثورة في تقييم مصداقية الإحالات العلمية: هل يمكن الوثوق بالسيرورات الذكية؟
أبحاث

ثورة في تقييم مصداقية الإحالات العلمية: هل يمكن الوثوق بالسيرورات الذكية؟

أركايف للذكاءمنذ 1 شهر
👁 2
انحياز التفضيل الذاتي في تقييم نماذج اللغات الضخمة: دراسة جديدة تكشف النقاب عن المشكلة الخطيرة!
أبحاث

انحياز التفضيل الذاتي في تقييم نماذج اللغات الضخمة: دراسة جديدة تكشف النقاب عن المشكلة الخطيرة!

أركايف للذكاءمنذ 1 شهر
👁 1
ثورة في تقييم الذكاء الاصطناعي: إطار جديد لتدقيق الإجابات المعتمدة على الاستدلال!
أبحاث

ثورة في تقييم الذكاء الاصطناعي: إطار جديد لتدقيق الإجابات المعتمدة على الاستدلال!

أركايف للذكاءمنذ 1 شهر
👁 1