🏷️ #تقييم
379 مقال
أبحاث
EComAgentBench: ثورة في تقييم وكالات التسوق الذكي عبر مهام طويلة الأمد!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
استخدام نماذج لغوية ضخمة كقضاة في التعليم: مسار تقييم يعتمد على المناهج الدراسية
أركايف للذكاءمنذ 2 شهر
أبحاث
SEAGym: بيئة تقييم مبتكرة لوكلاء LLM القابلين للتطور الذاتي
أركايف للذكاءمنذ 2 شهر
أبحاث
DeepInsight: ثورة في تقييم مجموعات الذكاء الاصطناعي المدمجة
أركايف للذكاءمنذ 2 شهر
أخلاقيات الذكاء الاصطناعي
AuAu: معيار جديد لتقييم تحيزات الأنظمة اللغوية نحو الاستبداد!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!
أركايف للذكاءمنذ 2 شهر
نماذج لغوية
تجاوز الصواب: تعزيز الفهم المعماري في نماذج البرمجة عبر تقييم متدرج مع حكم آلي
أركايف للذكاءمنذ 2 شهر
أبحاث
نموذج الذكاء الاصطناعي: تقييم أولي لنقاط المخطوطات ودقتها في تقديم نتائج مراجعة الأقران!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
إطار عمل استرجاع Agents للقيام بتقييم جودة البيانات بشكل مستقل وذكي
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
تمثيل يومي: كيفية تقييم وكلاء البحث في مهام البحث اليومية بذكاء متطور!
أركايف للذكاءمنذ 2 شهر
أبحاث
تطوير ثوري في تقييم الصحة النفسية: استراتيجيات جديدة تعتمد على الذكاء الاصطناعي
أركايف للذكاءمنذ 2 شهر
أبحاث
CMI-RewardBench: ثورة في تقييم نماذج مكافآت الموسيقى من خلال التعليمات المتعددة الوسائط
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
ثورة جديدة في تقييم ذكاء الآلات: استراتيجيات مبتكرة لقياس التفكير الإجرائي!
أركايف للذكاءمنذ 2 شهر
أبحاث
WildIFEval: ثورة في فهم التعليمات المعقدة للذكاء الاصطناعي!
أركايف للذكاءمنذ 2 شهر
أبحاث
تقييم مخصص للذكاء الاصطناعي: كيف نتنبأ بمخاطر رفض استجابات نموذج اللغة الطبية؟
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
مقياس MobilityBench: معيار جديد لتقييم وكلاء تخطيط الطرق في سيناريوهات التنقل الواقعية
أركايف للذكاءمنذ 2 شهر
أبحاث
ابتكار آلي: تقييم إبداع نماذج اللغة عبر مهام مفتوحة بشكل ثوري!
أركايف للذكاءمنذ 2 شهر
أبحاث
اكتشاف إمكانيات جديدة في الذكاء الاصطناعي مع نظام Embodied-BenchClaw الثوري!
أركايف للذكاءمنذ 2 شهر
أبحاث
إطلاق IntElicit: إطار مبتكر لتقييم الإبداع في بيئة الحوار المتفاعل!
أركايف للذكاءمنذ 2 شهر
أبحاث
تحقيق الانتصار في أبحاث الذكاء الاصطناعي: كيفية تحسين قرارات الوكالات البحثية
أركايف للذكاءمنذ 2 شهر
