🏷️ #تقييم
275 مقال
أخلاقيات الذكاء الاصطناعي
AuAu: معيار جديد لتقييم تحيزات الأنظمة اللغوية نحو الاستبداد!
أركايف للذكاءمنذ 1 شهر
أبحاث
اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!
أركايف للذكاءمنذ 1 شهر
نماذج لغوية
تجاوز الصواب: تعزيز الفهم المعماري في نماذج البرمجة عبر تقييم متدرج مع حكم آلي
أركايف للذكاءمنذ 1 شهر
أبحاث
نموذج الذكاء الاصطناعي: تقييم أولي لنقاط المخطوطات ودقتها في تقديم نتائج مراجعة الأقران!
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
إطار عمل استرجاع Agents للقيام بتقييم جودة البيانات بشكل مستقل وذكي
أركايف للذكاءمنذ 1 شهر
أبحاث
تمثيل يومي: كيفية تقييم وكلاء البحث في مهام البحث اليومية بذكاء متطور!
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة جديدة في تقييم ذكاء الآلات: استراتيجيات مبتكرة لقياس التفكير الإجرائي!
أركايف للذكاءمنذ 1 شهر
أبحاث
تقييم مخصص للذكاء الاصطناعي: كيف نتنبأ بمخاطر رفض استجابات نموذج اللغة الطبية؟
أركايف للذكاءمنذ 1 شهر
أبحاث
تطوير ثوري في تقييم الصحة النفسية: استراتيجيات جديدة تعتمد على الذكاء الاصطناعي
أركايف للذكاءمنذ 1 شهر
أبحاث
CMI-RewardBench: ثورة في تقييم نماذج مكافآت الموسيقى من خلال التعليمات المتعددة الوسائط
أركايف للذكاءمنذ 1 شهر
أبحاث
WildIFEval: ثورة في فهم التعليمات المعقدة للذكاء الاصطناعي!
أركايف للذكاءمنذ 1 شهر
أبحاث
تحقيق الانتصار في أبحاث الذكاء الاصطناعي: كيفية تحسين قرارات الوكالات البحثية
أركايف للذكاءمنذ 1 شهر
أبحاث
اكتشاف إمكانيات جديدة في الذكاء الاصطناعي مع نظام Embodied-BenchClaw الثوري!
أركايف للذكاءمنذ 1 شهر
أبحاث
إطلاق IntElicit: إطار مبتكر لتقييم الإبداع في بيئة الحوار المتفاعل!
أركايف للذكاءمنذ 1 شهر
أبحاث
مقياس MobilityBench: معيار جديد لتقييم وكلاء تخطيط الطرق في سيناريوهات التنقل الواقعية
أركايف للذكاءمنذ 1 شهر
أبحاث
ابتكار آلي: تقييم إبداع نماذج اللغة عبر مهام مفتوحة بشكل ثوري!
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة جديدة في علوم الأحياء: BioDivergence تكشف عن تعقيد التناقضات السياقية
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة جديدة في تقييم النص إلى موسيقى: اكتشف كيف يغير DeRA-MOS القواعد!
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة في عالم الرياضيات: ComBench معيار جديد لتقييم الذكاء الاصطناعي في المسائل التوافقية!
أركايف للذكاءمنذ 1 شهر
أبحاث
تحديات تقييم نماذج اللغة الكبيرة في الرعاية الصحية: أين يكمن الخلل؟
أركايف للذكاءمنذ 1 شهر
