Ailoxa Logo

🏷️ #تقييم

275 مقال

فخ الإجابة الصحيحة: كيف تخفق أنظمة التعليم الذكية في تقييم تفكير الطلاب؟
أبحاث

فخ الإجابة الصحيحة: كيف تخفق أنظمة التعليم الذكية في تقييم تفكير الطلاب؟

أركايف للذكاءمنذ 1 شهر
ضرورة توفير بيانات قياسية لتقييم الذكاء الاصطناعي: نحو بنية تحتية موحدة!
أبحاث

ضرورة توفير بيانات قياسية لتقييم الذكاء الاصطناعي: نحو بنية تحتية موحدة!

أركايف للذكاءمنذ 1 شهر
ثورة في تقييم وكالات البرمجة: اكتشفوا ProcBench وما يحمله من ابتكار!
أبحاث

ثورة في تقييم وكالات البرمجة: اكتشفوا ProcBench وما يحمله من ابتكار!

أركايف للذكاءمنذ 2 شهر
كيف يمكن أن تتحصن مجموعات البيانات المرجعية ضد التلوث؟
أبحاث

كيف يمكن أن تتحصن مجموعات البيانات المرجعية ضد التلوث؟

أركايف للذكاءمنذ 2 شهر
ثورة في التفكير الرياضي: كيف تغيّر نماذج اللغة الضخمة (LLMs) مستقبل الذكاء الاصطناعي؟
أبحاث

ثورة في التفكير الرياضي: كيف تغيّر نماذج اللغة الضخمة (LLMs) مستقبل الذكاء الاصطناعي؟

أركايف للذكاءمنذ 2 شهر
اختيار نقاط التحقق الفعّالة لنماذج اللغات متعددة الوسائط عبر تقييم ديناميكي وترتيب مدروس
نماذج لغوية

اختيار نقاط التحقق الفعّالة لنماذج اللغات متعددة الوسائط عبر تقييم ديناميكي وترتيب مدروس

أركايف للذكاءمنذ 2 شهر
SwordBench: المعيار الثوري لتقييم استقلالية تمثيلات الصور في الذكاء الاصطناعي
أبحاث

SwordBench: المعيار الثوري لتقييم استقلالية تمثيلات الصور في الذكاء الاصطناعي

أركايف للذكاءمنذ 2 شهر
👁 1
تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!
أبحاث

تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!

أركايف للذكاءمنذ 2 شهر
تقييم نماذج اللغة الكبيرة: قفزة في فهم سلوكيات الفئران من خلال CheeseBench!
أبحاث

تقييم نماذج اللغة الكبيرة: قفزة في فهم سلوكيات الفئران من خلال CheeseBench!

أركايف للذكاءمنذ 2 شهر
AgroCoT: معيار مبتكر لتقييم التفكير المنطقي في نماذج الرؤية واللغة في الزراعة
أبحاث

AgroCoT: معيار مبتكر لتقييم التفكير المنطقي في نماذج الرؤية واللغة في الزراعة

أركايف للذكاءمنذ 2 شهر
الذكاء الاصطناعي في قياس صعوبة الاختبارات: خبراء جدد في عالم التعلم!
أبحاث

الذكاء الاصطناعي في قياس صعوبة الاختبارات: خبراء جدد في عالم التعلم!

أركايف للذكاءمنذ 2 شهر
👁 1
ثورة جديدة في قياس صعوبة الأسئلة: نموذج بدون استجابة باستخدام التحويلات المتقدمة!
أبحاث

ثورة جديدة في قياس صعوبة الأسئلة: نموذج بدون استجابة باستخدام التحويلات المتقدمة!

أركايف للذكاءمنذ 2 شهر
CAREBench: الاختبار الثوري لفهم المشاعر في نماذج الذكاء الاصطناعي!
أبحاث

CAREBench: الاختبار الثوري لفهم المشاعر في نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
هل يكفي تقييم واحد؟ إعادة التفكير في تقييم ذاكرة نماذج اللغات الضخمة المتطورة

هل يكفي تقييم واحد؟ إعادة التفكير في تقييم ذاكرة نماذج اللغات الضخمة المتطورة

أركايف للذكاءمنذ 2 شهر
HAI-Eval: قياس تناغم البشر والذكاء الاصطناعي في البرمجة التعاونية
أبحاث

HAI-Eval: قياس تناغم البشر والذكاء الاصطناعي في البرمجة التعاونية

أركايف للذكاءمنذ 2 شهر
LEAP: كيف تقيم كفاءة التعلم في نماذج الذكاء الاصطناعي لتعزيز التصميم العلمي
أبحاث

LEAP: كيف تقيم كفاءة التعلم في نماذج الذكاء الاصطناعي لتعزيز التصميم العلمي

أركايف للذكاءمنذ 2 شهر
تجارة الماشية: معيار متعدد الوكلاء لتقييم قدرات نماذج اللغة الكبيرة في استراتيجيات المقامرة والمساومة
أبحاث

تجارة الماشية: معيار متعدد الوكلاء لتقييم قدرات نماذج اللغة الكبيرة في استراتيجيات المقامرة والمساومة

أركايف للذكاءمنذ 2 شهر
ثورة في مقاييس تقييم نماذج الذكاء الاصطناعي: كيفية تشكيل الثقافة من خلال المعايير
أبحاث

ثورة في مقاييس تقييم نماذج الذكاء الاصطناعي: كيفية تشكيل الثقافة من خلال المعايير

أركايف للذكاءمنذ 2 شهر
شكرًا ل ChromaFlow: دراسة مبتكرة تكشف النقاب عن تحديات تقييم الوكلاء المدعومين بالأدوات
أبحاث

شكرًا ل ChromaFlow: دراسة مبتكرة تكشف النقاب عن تحديات تقييم الوكلاء المدعومين بالأدوات

أركايف للذكاءمنذ 2 شهر
تحسين وتقييم خرائط الخصائص التفسيرية للذكاء الاصطناعي: طُرق مبتكرة ونتائج مبهرة!
أبحاث

تحسين وتقييم خرائط الخصائص التفسيرية للذكاء الاصطناعي: طُرق مبتكرة ونتائج مبهرة!

أركايف للذكاءمنذ 2 شهر