🏷️ #تقييم
379 مقال
روبوتات
RoboEval: ثورة في تقييم الأداء الروبوتي من خلال مقاييس شاملة ومباشرة
أركايف للذكاءمنذ 4 شهر
أبحاث
إطلاق CreativityBench: معيار جديد لتقييم الإبداع في الذكاء الاصطناعي من خلال إعادة استخدام الأدوات!
أركايف للذكاءمنذ 4 شهر
👁 2أبحاث
تقييم الأنظمة المستقلة في الوقت الحقيقي تحت هجمات معادية: كيف نحقق الأمان في القيادة الذاتية؟
أركايف للذكاءمنذ 4 شهر
👁 1أبحاث
MCJudgeBench: الثورية في تقييم القضاة على مستوى القيود في تنفيذ التعليمات المتعددة!
أركايف للذكاءمنذ 4 شهر
👁 3أبحاث
هل يمكنك الوثوق بالاستثمارات المدعومة بالذكاء الاصطناعي؟ تعرف على قيمة ValueBlindBench!
أركايف للذكاءمنذ 4 شهر
👁 2أبحاث
اكتشاف الحدود: منصة oMeBench لقياس قدرة نماذج اللغة في فهم آليات التفاعلات العضوية
أركايف للذكاءمنذ 4 شهر
أبحاث
ثورة تقييم الذكاء الاصطناعي: المبادئ التوجيهية لتجارب التحكم العشوائي
أركايف للذكاءمنذ 4 شهر
👁 1أبحاث
اكتشاف الذكاء الاصطناعي الوكّي: ثغرات ومخاطر تتطلب إطار تقييم مبتكر!
أركايف للذكاءمنذ 4 شهر
👁 2أبحاث
مغامرة الذاكرة الذكية: تعرف على بروتوكول MEMAUDIT الثوري لتقييم الكتابة الطويلة الأمد!
أركايف للذكاءمنذ 4 شهر
أبحاث
إطلاق إطار CLEAR: كيف تؤثر الضوضاء والغموض على موثوقية النماذج اللغوية الكبيرة في الطب؟
أركايف للذكاءمنذ 4 شهر
أبحاث
مؤشر GR-Ben: ثورة في تقييم نماذج المكافآت العملية في الذكاء الاصطناعي
أركايف للذكاءمنذ 4 شهر
أبحاث
اكتشاف إمكانيات الذكاء الاصطناعي: MCP-Atlas يرفع مستوى الكفاءة في استخدام الأدوات
أركايف للذكاءمنذ 4 شهر
أبحاث
من المختبر إلى العالم الحقيقي: تقييم التفكير البرمجي في مستوى المستودع
أركايف للذكاءمنذ 4 شهر
أبحاث
سورج: إطار تقييم جديد لتحسين توليد الاستبيانات العلمية
أركايف للذكاءمنذ 4 شهر
أبحاث
ثورة التعليم: تقييم نماذج اللغة متعددة الوسائط لحل مشكلات طلاب STEM في الجامعات
أركايف للذكاءمنذ 4 شهر
أبحاث
FinChain: المعلم الرمزي الجديد في تقييم التحليل المالي القابل للتحقق
أركايف للذكاءمنذ 4 شهر
👁 1أبحاث
اكتشف Auto-ARGUE: ثورة جديدة في تقييم توليد التقارير المعتمدة على الذكاء الاصطناعي!
أركايف للذكاءمنذ 4 شهر
أبحاث
إعادة التفكير في معايير الذكاء الاصطناعي في الرعاية الصحية: إطار MedCheck الثوري!
أركايف للذكاءمنذ 4 شهر
👁 1أبحاث
دراسة مثيرة: كيف تؤثر الهوية في تقييم نماذج الذكاء الاصطناعي متعدد الوكلاء؟
أركايف للذكاءمنذ 4 شهر
أبحاث
كيف تُغير نماذج اللغة الذكية طريقة تقييم الرياضيات؟ اكتشاف أخطاء تقييم التعلم بالإصلاح المفرط!
أركايف للذكاءمنذ 4 شهر
👁 1