🏷️ #معيار
7 مقال
أبحاث
PetriBench: المعيار الجديد لقياس التفكير في نماذج اللغات الضخمة (LLM) عبر فضاءات الحالة الديناميكية
أركايف للذكاءمنذ 11 يوم
👁 2أبحاث
PROC-Arena: أداة مبتكرة لتقييم نماذج اللغات الضخمة في تطوير PL/SQL من اللغة الطبيعية!
أركايف للذكاءمنذ 19 يوم
👁 1أبحاث
استكشاف SteerBench-Work: معيار جديد لتوجيه الوكلاء في الحدود الحرجة
أركايف للذكاءمنذ 1 شهر
👁 3أبحاث
إطلاق LigBench: معيار مبتكر لتوليد أفكار البحث المعتمدة على نماذج اللغة الضخمة!
أركايف للذكاءمنذ 1 شهر
👁 2أبحاث
اختبار الطيران: معيار ثوري لتقييم نماذج الذكاء الاصطناعي في قطاع الطيران
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
MindEdit-Bench: معيار جديد لتقييم قدرة نماذج اللغة والرؤية على التفكير المكاني النقدي
أركايف للذكاءمنذ 2 شهر
👁 2أبحاث
تعرّف على WorldRoamBench: المعيار الثوري لقياس استقرار النماذج التفاعلية في عالم مفتوح
أركايف للذكاءمنذ 3 شهر
👁 3