Ailoxa Logo

🏷️ #تقييم

277 مقال

كيف تغيرت آراء مراجعة الأقران بفضل نماذج اللغات الضخمة؟
أبحاث

كيف تغيرت آراء مراجعة الأقران بفضل نماذج اللغات الضخمة؟

أركايف للذكاءمنذ 3 شهر
ابتكار جديد: كيفية تعزيز الاكتشافات العلمية من خلال القياس المدعوم بالتقييم
أبحاث

ابتكار جديد: كيفية تعزيز الاكتشافات العلمية من خلال القياس المدعوم بالتقييم

أركايف للذكاءمنذ 3 شهر
CulturALL: تحدي تقييم ذكاء النماذج اللغوية متعددة الثقافات واللغات!
نماذج لغوية

CulturALL: تحدي تقييم ذكاء النماذج اللغوية متعددة الثقافات واللغات!

أركايف للذكاءمنذ 3 شهر
إطار عمل LLM كقاضي: تقييم الخيال الناتج عن نبرة المدخلات في نماذج اللغة والرؤية
أبحاث

إطار عمل LLM كقاضي: تقييم الخيال الناتج عن نبرة المدخلات في نماذج اللغة والرؤية

أركايف للذكاءمنذ 3 شهر
AlphaContext: ثورة في توليد السياقات النفسية لتقييم الإبداع
أبحاث

AlphaContext: ثورة في توليد السياقات النفسية لتقييم الإبداع

أركايف للذكاءمنذ 3 شهر
دليل شامل لتقييم مساعدي الذكاء الاصطناعي: سحابيات مقابل محليين في استخراج السلاسل السببية
أبحاث

دليل شامل لتقييم مساعدي الذكاء الاصطناعي: سحابيات مقابل محليين في استخراج السلاسل السببية

أركايف للذكاءمنذ 3 شهر
RepIt: الابتكار الذي يكشف عيوب نماذج اللغة في تقييم السلامة
أبحاث

RepIt: الابتكار الذي يكشف عيوب نماذج اللغة في تقييم السلامة

أركايف للذكاءمنذ 3 شهر
مؤشر الدفاع السيبراني: تقييم مطاردة التهديدات باستخدام نماذج اللغة في عمليات الأمان
أبحاث

مؤشر الدفاع السيبراني: تقييم مطاردة التهديدات باستخدام نماذج اللغة في عمليات الأمان

أركايف للذكاءمنذ 3 شهر
ابتكار MTR-DuplexBench: تقييم شامل للمحادثات المتعددة للجولات في نماذج الكلام المزدوج
أبحاث

ابتكار MTR-DuplexBench: تقييم شامل للمحادثات المتعددة للجولات في نماذج الكلام المزدوج

أركايف للذكاءمنذ 3 شهر
BAGEL: معيار جديد لتقييم معرفة نماذج اللغة حول الحياة الحيوانية
أبحاث

BAGEL: معيار جديد لتقييم معرفة نماذج اللغة حول الحياة الحيوانية

أركايف للذكاءمنذ 3 شهر
PRL-Bench: المعيار الشامل لقياس قدرات نماذج الذكاء الاصطناعي في أبحاث الفيزياء الرائدة
أبحاث

PRL-Bench: المعيار الشامل لقياس قدرات نماذج الذكاء الاصطناعي في أبحاث الفيزياء الرائدة

أركايف للذكاءمنذ 3 شهر
👁 1
تطوير ثوري: إطلاق vla-eval لتقييم نماذج الرؤية واللغة والعمل
أدوات

تطوير ثوري: إطلاق vla-eval لتقييم نماذج الرؤية واللغة والعمل

أركايف للذكاءمنذ 3 شهر
ثورة في تجربة المستخدم: Avenir-UX لتقييم واجهات المواقع بشكل آلي يغير قواعد اللعبة!
أدوات

ثورة في تجربة المستخدم: Avenir-UX لتقييم واجهات المواقع بشكل آلي يغير قواعد اللعبة!

أركايف للذكاءمنذ 3 شهر
استكشاف قدرات التفكير المنطقي لنماذج اللغات الضخمة: رؤية عبر بنية تشومسكي
نماذج لغوية

استكشاف قدرات التفكير المنطقي لنماذج اللغات الضخمة: رؤية عبر بنية تشومسكي

أركايف للذكاءمنذ 3 شهر
LongCoT: معيار جديد لقياس قدرة الذكاء الاصطناعي على التفكير العميق
أبحاث

LongCoT: معيار جديد لقياس قدرة الذكاء الاصطناعي على التفكير العميق

أركايف للذكاءمنذ 3 شهر
تقييم نماذج التعلم الآلي المُشرف: المبادئ، التحديات، واختيار المقاييس الفعّالة
أبحاث

تقييم نماذج التعلم الآلي المُشرف: المبادئ، التحديات، واختيار المقاييس الفعّالة

أركايف للذكاءمنذ 3 شهر
ما هو BenGER؟ منصة ويب مبتكرة لتقييم المهام القانونية الألمانية
أبحاث

ما هو BenGER؟ منصة ويب مبتكرة لتقييم المهام القانونية الألمانية

أركايف للذكاءمنذ 3 شهر
InfiniteScienceGym: معايير مبتكرة لتحليل علمي غير محدود
أبحاث

InfiniteScienceGym: معايير مبتكرة لتحليل علمي غير محدود

أركايف للذكاءمنذ 3 شهر
قفزة مذهلة في تقييم جودة التفكير: استكشاف Score المنطق المدعوم!
أبحاث

قفزة مذهلة في تقييم جودة التفكير: استكشاف Score المنطق المدعوم!

أركايف للذكاءمنذ 3 شهر
قفزة ثورية في تقييم نماذج اللغة الكبيرة: الكشف عن جودة التفكير في مهام البرمجة
أبحاث

قفزة ثورية في تقييم نماذج اللغة الكبيرة: الكشف عن جودة التفكير في مهام البرمجة

أركايف للذكاءمنذ 3 شهر