🏷️ #المعايير
11 مقال
أبحاث
SceneBench: معيار ثوري لفهم المشاهد ثلاثية الأبعاد بين اللغة والرؤية!
أركايف للذكاءمنذ 2 يوم
أبحاث
UTP-Bench: معيار جديد لتخطيط الرحلات في ظل عدم اليقين!
أركايف للذكاءمنذ 15 يوم
👁 1أبحاث
تقييم جديد: معايير تحرير المعرفة تُظهر تحديات خطيرة في تصنيف النطاق!
أركايف للذكاءمنذ 21 يوم
👁 2أبحاث
استكشاف المخاطر الخفية: GuardianBench كمعيار ثوري للذكاء الاصطناعي المتمثل
أركايف للذكاءمنذ 24 يوم
👁 1أبحاث
هل تعاني الوكلاء الذكاء الاصطناعي من المديح المفرط؟ اكتشفوا قياسات سلوكهم الإيجابي المستدام!
أركايف للذكاءمنذ 2 شهر
👁 2أبحاث
SWE-Marathon: هل يمكن للذكاء الاصطناعي إكمال مهام تطوير البرمجيات المعقدة بشكل مستقل؟
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
AutoLab: معيار جديد لإجراء أبحاث وهندسة السيارات على المدى الطويل
أركايف للذكاءمنذ 3 شهر
👁 2نماذج لغوية
أحدث ابتكارات الذكاء الاصطناعي: RoleCDE لتحسين أداء الوكلاء في الأدوار! 🚀
أركايف للذكاءمنذ 3 شهر
👁 2أبحاث
VT-Bench: المعيار الثوري لتعلم البيانات المرئية والجدولية متعدد النماذج!
أركايف للذكاءمنذ 4 شهر
👁 3أبحاث
LithoBench: ثورة في تفسير طبقات الصخور عبر النماذج المتعددة الأنماط
أركايف للذكاءمنذ 4 شهر
👁 2أبحاث
اكتشاف AgentFloor: إلى أي مدى يمكن لنماذج الذكاء الاصطناعي الصغيرة التقدم في استخدام الأدوات؟
أركايف للذكاءمنذ 4 شهر
👁 2