🏷️ #تقييم
277 مقال
أبحاث
تقييم وكيل البحث في عالم متوازي: كيف نواجه تحديات الذكاء الاصطناعي؟
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
QEVA: المعيار الثوري لتقييم تلخيص الفيديوهات بلا مراجع
أركايف للذكاءمنذ 2 شهر
أبحاث
فيسكود بينش: ثورة في محاكاة المشاهد ثلاثية الأبعاد بفهم فيزيائي مبتكر!
أركايف للذكاءمنذ 2 شهر
أبحاث
دراسة مثيرة: كيف تؤثر الهوية في تقييم نماذج الذكاء الاصطناعي متعدد الوكلاء؟
أركايف للذكاءمنذ 2 شهر
أبحاث
تعلم لغة بشكل مبتكر: إطار تعليمي شخصي مُعتمد على مناظرات الذكاء الاصطناعي!
أركايف للذكاءمنذ 2 شهر
أدوات
STELLAR-E: ثورة جديدة في تقييم تطبيقات نماذج اللغات الضخمة!
أركايف للذكاءمنذ 2 شهر
أبحاث
هل تهدد نماذج الذكاء الاصطناعي سلامة أبحاث الذكاء الاصطناعي؟
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة في تقييم الحقائق: اكتشاف أداة AtomEval لتحديد الفساد المعلوماتي
أركايف للذكاءمنذ 2 شهر
أبحاث
إعادة تشكيل التنسيق الطارئ في نماذج اللغات الكبيرة: إطار تقييم مبتكر على أرشيف MoltBook
أركايف للذكاءمنذ 2 شهر
نماذج لغوية
استراتيجيات ثورية لتقييم نماذج الذكاء الاصطناعي: مراجعة الأقران تضمن التميز!
أركايف للذكاءمنذ 2 شهر
أبحاث
MermaidSeqBench: معيار جديد لتقييم توليد مخططات التتابع من اللغة الطبيعية!
أركايف للذكاءمنذ 2 شهر
أبحاث
نحو تقييم شامل لنماذج الصوت واللغة: استعراض كامل للتطورات المستقبلية!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
إعادة تفكير في تقييم الذكاء الاصطناعي القابل للتفسير: تدقيق إنساني لقيم شابلي في البيئات عالية المخاطر
أركايف للذكاءمنذ 2 شهر
👁 2أبحاث
إعادة التفكير في تقييم التفكير الرياضي: إطار عمل قوي لتقييم النماذج اللغوية الكبيرة
أركايف للذكاءمنذ 2 شهر
أبحاث
OpenEstimate: ثورة في تقييم نماذج الذكاء الاصطناعي في مواجهة عدم اليقين!
أركايف للذكاءمنذ 2 شهر
أبحاث
ابتكار نظام تقييم مبتكر لتلخيص الاجتماعات باستخدام الذكاء الاصطناعي: تفاصيل مثيرة!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
تجاوز فخ الاتفاق: إشارات الدفاع لتقييم الذكاء الاصطناعي القائم على القوانين
أركايف للذكاءمنذ 2 شهر
أبحاث
CyberCertBench: أداة مبتكرة لتقييم مهارات نماذج اللغة في أمن المعلومات
أركايف للذكاءمنذ 3 شهر
أبحاث
OMIBench: ثورة في تقييم القدرة الاستدلالية للنماذج البصرية اللغوية المتقدمة!
أركايف للذكاءمنذ 3 شهر
أبحاث
تسليط الضوء على تأثيرات النماذج اللغوية الضخمة: إطار شفاف لتقدير الأداء
أركايف للذكاءمنذ 3 شهر
