🏷️ #التقييم الذاتي
4 مقال
أبحاث
هل تستطيع نماذج اللغات الضخمة (LLMs) الحكم بشكل أفضل من توليد النصوص؟ تحليل مثير حول تقييم دقة الإجابات
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
ResearchClawBench: معيار ثوري لتقييم الأبحاث العلمية الذاتية
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
لعبة التقييم الجديدة: كيف تتفاعل المراجعات المدعومة بالذكاء الاصطناعي مع البشر؟
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
سلامة الذكاء الاصطناعي: تقييم خطط السلامة في نماذج اللغات متعددة الوسائط!
أركايف للذكاءمنذ 3 شهر
👁 1