🏷️ #تقييم الأداء
167 مقال
أبحاث
اكتشاف معاناة وكالات البرمجة: كيف تتدهور الكودات مع SlopCodeBench
أركايف للذكاءمنذ 2 شهر
👁 2أبحاث
الحلول الدقيقة: الثقة في تقييمات وكلاء LLM التعاونية
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
اختبار حساسية النصوص: كيف تتفاعل نماذج الذكاء الاصطناعي مع لغات العالم المتعددة؟
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
عندما تتوقف الأدلة المخزنة عن كونها قابلة للاستخدام: تقييم ذاكرة الوكيل في ظل نمو الأدلة
أركايف للذكاءمنذ 2 شهر
أبحاث
كيف تعاني نماذج اللغة والرؤية (VLMs) من ضعف الوعي بالخصوصية في العالم المادي؟
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة جديدة في علوم الحياة: تقديم BioAgent Bench لتقييم وكيل الذكاء الاصطناعي في المعلومات الحيوية
أركايف للذكاءمنذ 2 شهر
أبحاث
كيف تُعزز أنظمة الذكاء الاصطناعي تجربة التعلم؟ اكتشافات من 10,000 مشاركة طلابية
أركايف للذكاءمنذ 2 شهر
أبحاث
اختبار Vibe Code Bench: تقييم نماذج الذكاء الاصطناعي في تطوير تطبيقات الويب بشكل شامل!
أركايف للذكاءمنذ 2 شهر
أبحاث
Workspace-Bench 1.0: انطلاقة جديدة في تقييم وكلاء الذكاء الاصطناعي في مهام العمل المعقدة
أركايف للذكاءمنذ 2 شهر
أبحاث
EngiBench: المعيار الثوري لتقييم نماذج اللغة الكبيرة في حل المشكلات الهندسية!
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة الذكاء الاصطناعي في الألعاب: تقييم محتوى لعبة الجري اللانهائي باستخدام وكلاء ذاتية
أركايف للذكاءمنذ 2 شهر
أبحاث
ثقة كبيرة في الذكاء الاصطناعي: كيف تؤثر طريقة التفكير على أداء نماذج اللغات الضخمة؟
أركايف للذكاءمنذ 2 شهر
روبوتات
استراتيجيات مبتكرة لتحسين المساعدين الافتراضيين في التسوق عبر الذكاء الاصطناعي
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
كيف يفهم GPT-4o الرؤية؟ تقييم النماذج متعددة الوسائط في مهام الرؤية الحاسوبية
أركايف للذكاءمنذ 2 شهر
أدوات
تحديات تقييم نظام تحويل النصوص إلى استعلامات SQL: إطار عمل جديد يتجاوز الحدود التقليدية!
أركايف للذكاءمنذ 2 شهر
أبحاث
تحدي Claw-Eval-Live: معايير جديدة لتقييم وكيل الذكاء الاصطناعي في بيئات العمل الواقعية
أركايف للذكاءمنذ 2 شهر
نماذج لغوية
اكتشافات مذهلة في تقييم نماذج اللغات: تحليل تغيرات موثوقة بشكل غير مسبوق!
أركايف للذكاءمنذ 2 شهر
أبحاث
معايير تقييم السلامة في المسارات لوكالة الذكاء الاصطناعي: اكتشفوا ATBench-Claw وATBench-Codex!
أركايف للذكاءمنذ 2 شهر
أبحاث
CFDLLMBench: طراز جديد لتقييم نماذج اللغة الكبيرة في ديناميكا السوائل الحاسوبية
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
كيف تقيم أداء نماذج اللغات الضخمة في مراجعات الأدبيات؟ إليك التوصيات اللازمة!
أركايف للذكاءمنذ 2 شهر
