🏷️ #تقييم
379 مقال
أبحاث
تحدي CyberGym-E2E: منصة رائدة لتقييم قدرات الذكاء الاصطناعي في مجال الأمن السيبراني!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
هل يمكنك تناول جرعة إضافية؟ تقييم قرارات نماذج اللغة الكبيرة تحت عدم اليقين الزمني في أسئلة جرعات الأدوية
أركايف للذكاءمنذ 3 شهر
👁 1نماذج لغوية
اكتشف مؤشرات المعرفة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
من الفكرة إلى التنفيذ: تصنيف العمليات وتقييم الأطر الداعمة لوكلاء تطوير البرمجيات الذكية
أركايف للذكاءمنذ 3 شهر
👁 2أبحاث
معايير جديدة لتقييم نماذج اللغة: أداة CoEval تُحدث ثورة في الاستخدامات الخاصة!
أركايف للذكاءمنذ 3 شهر
👁 2أبحاث
WISE: تقييم سماتي متقدم لدمج المعرفة العالمية في توليد الصور من النصوص
أركايف للذكاءمنذ 3 شهر
👁 3نماذج لغوية
كيف يمكن لنماذج اللغة الكبيرة تحسين دقة الحكم؟ اكتشف السر وراء وقت الاستدلال المتوازن!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
كيف تؤثر بروتوكولات التسجيل على أداء الذكاء الاصطناعي في اتخاذ قرارات طبية معقدة؟
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
ForeSci: معيار جديد لتقييم وكلاء الذكاء الاصطناعي في اتخاذ قرارات بحثية استشرافية مذهلة!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
استكشاف جودة العمليات: AgentProcessBench لتقييم فعالية وكالات استخدام الأدوات!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
ReasonBench: كيف يكشف عدم الاستقرار في نماذج الذكاء الاصطناعي عن تحديات جديدة!
أركايف للذكاءمنذ 3 شهر
👁 1تجاوز انحياز الحكم الإدراكي: نهج مبتكر لتدريب نماذج الذكاء الاصطناعي متعددة الوسائط
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
تعزيز كفاءة نماذج اللغات الضخمة: كيف تختار الأفضل بذكاء! 🚀
أركايف للذكاءمنذ 3 شهر
أبحاث
ثورة في تصميم العمارة البرمجية: كيف تسهم مجموعة من الوكلاء الذكيين في إحداث تغيير حقيقي؟
أركايف للذكاءمنذ 3 شهر
أبحاث
ثورة جديدة في تقييم توليد الوجوه المتحدثة بواسطة الصوت: تقييم متوازن زمنياً
أركايف للذكاءمنذ 3 شهر
👁 1نماذج لغوية
اكتشافات مثيرة في دقة واستقرار نماذج اللغات الضخمة في المهام البرمجية
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
GenPT: ثورة جديدة في علم النفس باستخدام الفحص الاستدلالي الديناميكي!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
إطار عمل مبتكر لتقييم موثوقية نماذج الذكاء الاصطناعي في الرعاية الصحية!
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
انطلاقة جديدة في تقييم الذكاء الاصطناعي: BADGER يجمع بين العوامل الديناميكية والتقييم المحدد في استدلال الأعمال
أركايف للذكاءمنذ 3 شهر
👁 1أبحاث
قياس أداء التعلم المعزز: كيف يمكن للشهادات الذكية تغيير اللعبة؟
أركايف للذكاءمنذ 3 شهر
👁 1