Ailoxa Logo

🏷️ #تقييم

379 مقال

Verus-SpecGym: بيئة مبتكرة لتقييم تحويل المواصفات بدقة!
أبحاث

Verus-SpecGym: بيئة مبتكرة لتقييم تحويل المواصفات بدقة!

أركايف للذكاءمنذ 3 شهر
👁 1
استراتيجيات مبتكرة لتقييم الملخصات البحثية المُولّدة: كيف ستكون المستقبل!
أبحاث

استراتيجيات مبتكرة لتقييم الملخصات البحثية المُولّدة: كيف ستكون المستقبل!

أركايف للذكاءمنذ 3 شهر
RepoMirage: هل يمكن لوكلاء البرمجيات فهم سياق المستودعات البرمجية؟
أبحاث

RepoMirage: هل يمكن لوكلاء البرمجيات فهم سياق المستودعات البرمجية؟

أركايف للذكاءمنذ 3 شهر
فخ الإجابة الصحيحة: كيف تخفق أنظمة التعليم الذكية في تقييم تفكير الطلاب؟
أبحاث

فخ الإجابة الصحيحة: كيف تخفق أنظمة التعليم الذكية في تقييم تفكير الطلاب؟

أركايف للذكاءمنذ 3 شهر
كشف النقاب عن ChaosBench-Logic v2: تقييم تفكير LLMs في الأنظمة الديناميكية
أبحاث

كشف النقاب عن ChaosBench-Logic v2: تقييم تفكير LLMs في الأنظمة الديناميكية

أركايف للذكاءمنذ 3 شهر
ضرورة توفير بيانات قياسية لتقييم الذكاء الاصطناعي: نحو بنية تحتية موحدة!
أبحاث

ضرورة توفير بيانات قياسية لتقييم الذكاء الاصطناعي: نحو بنية تحتية موحدة!

أركايف للذكاءمنذ 3 شهر
ثورة في تقييم وكالات البرمجة: اكتشفوا ProcBench وما يحمله من ابتكار!
أبحاث

ثورة في تقييم وكالات البرمجة: اكتشفوا ProcBench وما يحمله من ابتكار!

أركايف للذكاءمنذ 3 شهر
كيف يمكن أن تتحصن مجموعات البيانات المرجعية ضد التلوث؟
أبحاث

كيف يمكن أن تتحصن مجموعات البيانات المرجعية ضد التلوث؟

أركايف للذكاءمنذ 3 شهر
ثورة في التفكير الرياضي: كيف تغيّر نماذج اللغة الضخمة (LLMs) مستقبل الذكاء الاصطناعي؟
أبحاث

ثورة في التفكير الرياضي: كيف تغيّر نماذج اللغة الضخمة (LLMs) مستقبل الذكاء الاصطناعي؟

أركايف للذكاءمنذ 3 شهر
اختيار نقاط التحقق الفعّالة لنماذج اللغات متعددة الوسائط عبر تقييم ديناميكي وترتيب مدروس
نماذج لغوية

اختيار نقاط التحقق الفعّالة لنماذج اللغات متعددة الوسائط عبر تقييم ديناميكي وترتيب مدروس

أركايف للذكاءمنذ 3 شهر
SwordBench: المعيار الثوري لتقييم استقلالية تمثيلات الصور في الذكاء الاصطناعي
أبحاث

SwordBench: المعيار الثوري لتقييم استقلالية تمثيلات الصور في الذكاء الاصطناعي

أركايف للذكاءمنذ 3 شهر
👁 1
تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!
أبحاث

تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!

أركايف للذكاءمنذ 3 شهر
تقييم نماذج اللغة الكبيرة: قفزة في فهم سلوكيات الفئران من خلال CheeseBench!
أبحاث

تقييم نماذج اللغة الكبيرة: قفزة في فهم سلوكيات الفئران من خلال CheeseBench!

أركايف للذكاءمنذ 3 شهر
AgroCoT: معيار مبتكر لتقييم التفكير المنطقي في نماذج الرؤية واللغة في الزراعة
أبحاث

AgroCoT: معيار مبتكر لتقييم التفكير المنطقي في نماذج الرؤية واللغة في الزراعة

أركايف للذكاءمنذ 3 شهر
الذكاء الاصطناعي في قياس صعوبة الاختبارات: خبراء جدد في عالم التعلم!
أبحاث

الذكاء الاصطناعي في قياس صعوبة الاختبارات: خبراء جدد في عالم التعلم!

أركايف للذكاءمنذ 3 شهر
👁 1
ثورة جديدة في قياس صعوبة الأسئلة: نموذج بدون استجابة باستخدام التحويلات المتقدمة!
أبحاث

ثورة جديدة في قياس صعوبة الأسئلة: نموذج بدون استجابة باستخدام التحويلات المتقدمة!

أركايف للذكاءمنذ 3 شهر
CAREBench: الاختبار الثوري لفهم المشاعر في نماذج الذكاء الاصطناعي!
أبحاث

CAREBench: الاختبار الثوري لفهم المشاعر في نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 3 شهر
هل يكفي تقييم واحد؟ إعادة التفكير في تقييم ذاكرة نماذج اللغات الضخمة المتطورة

هل يكفي تقييم واحد؟ إعادة التفكير في تقييم ذاكرة نماذج اللغات الضخمة المتطورة

أركايف للذكاءمنذ 3 شهر
HAI-Eval: قياس تناغم البشر والذكاء الاصطناعي في البرمجة التعاونية
أبحاث

HAI-Eval: قياس تناغم البشر والذكاء الاصطناعي في البرمجة التعاونية

أركايف للذكاءمنذ 3 شهر
👁 1
LEAP: كيف تقيم كفاءة التعلم في نماذج الذكاء الاصطناعي لتعزيز التصميم العلمي
أبحاث

LEAP: كيف تقيم كفاءة التعلم في نماذج الذكاء الاصطناعي لتعزيز التصميم العلمي

أركايف للذكاءمنذ 3 شهر