Ailoxa Logo

🏷️ #تقييم

379 مقال

تحدي CyberGym-E2E: منصة رائدة لتقييم قدرات الذكاء الاصطناعي في مجال الأمن السيبراني!
أبحاث

تحدي CyberGym-E2E: منصة رائدة لتقييم قدرات الذكاء الاصطناعي في مجال الأمن السيبراني!

أركايف للذكاءمنذ 3 شهر
👁 1
هل يمكنك تناول جرعة إضافية؟ تقييم قرارات نماذج اللغة الكبيرة تحت عدم اليقين الزمني في أسئلة جرعات الأدوية
أبحاث

هل يمكنك تناول جرعة إضافية؟ تقييم قرارات نماذج اللغة الكبيرة تحت عدم اليقين الزمني في أسئلة جرعات الأدوية

أركايف للذكاءمنذ 3 شهر
👁 1
اكتشف مؤشرات المعرفة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!
نماذج لغوية

اكتشف مؤشرات المعرفة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!

أركايف للذكاءمنذ 3 شهر
👁 1
من الفكرة إلى التنفيذ: تصنيف العمليات وتقييم الأطر الداعمة لوكلاء تطوير البرمجيات الذكية
أبحاث

من الفكرة إلى التنفيذ: تصنيف العمليات وتقييم الأطر الداعمة لوكلاء تطوير البرمجيات الذكية

أركايف للذكاءمنذ 3 شهر
👁 2
معايير جديدة لتقييم نماذج اللغة: أداة CoEval تُحدث ثورة في الاستخدامات الخاصة!
أبحاث

معايير جديدة لتقييم نماذج اللغة: أداة CoEval تُحدث ثورة في الاستخدامات الخاصة!

أركايف للذكاءمنذ 3 شهر
👁 2
WISE: تقييم سماتي متقدم لدمج المعرفة العالمية في توليد الصور من النصوص
أبحاث

WISE: تقييم سماتي متقدم لدمج المعرفة العالمية في توليد الصور من النصوص

أركايف للذكاءمنذ 3 شهر
👁 3
كيف يمكن لنماذج اللغة الكبيرة تحسين دقة الحكم؟ اكتشف السر وراء وقت الاستدلال المتوازن!
نماذج لغوية

كيف يمكن لنماذج اللغة الكبيرة تحسين دقة الحكم؟ اكتشف السر وراء وقت الاستدلال المتوازن!

أركايف للذكاءمنذ 3 شهر
👁 1
كيف تؤثر بروتوكولات التسجيل على أداء الذكاء الاصطناعي في اتخاذ قرارات طبية معقدة؟
أبحاث

كيف تؤثر بروتوكولات التسجيل على أداء الذكاء الاصطناعي في اتخاذ قرارات طبية معقدة؟

أركايف للذكاءمنذ 3 شهر
👁 1
ForeSci: معيار جديد لتقييم وكلاء الذكاء الاصطناعي في اتخاذ قرارات بحثية استشرافية مذهلة!
أبحاث

ForeSci: معيار جديد لتقييم وكلاء الذكاء الاصطناعي في اتخاذ قرارات بحثية استشرافية مذهلة!

أركايف للذكاءمنذ 3 شهر
👁 1
استكشاف جودة العمليات: AgentProcessBench لتقييم فعالية وكالات استخدام الأدوات!
أبحاث

استكشاف جودة العمليات: AgentProcessBench لتقييم فعالية وكالات استخدام الأدوات!

أركايف للذكاءمنذ 3 شهر
👁 1
ReasonBench: كيف يكشف عدم الاستقرار في نماذج الذكاء الاصطناعي عن تحديات جديدة!
أبحاث

ReasonBench: كيف يكشف عدم الاستقرار في نماذج الذكاء الاصطناعي عن تحديات جديدة!

أركايف للذكاءمنذ 3 شهر
👁 1
تجاوز انحياز الحكم الإدراكي: نهج مبتكر لتدريب نماذج الذكاء الاصطناعي متعددة الوسائط

تجاوز انحياز الحكم الإدراكي: نهج مبتكر لتدريب نماذج الذكاء الاصطناعي متعددة الوسائط

أركايف للذكاءمنذ 3 شهر
👁 1
تعزيز كفاءة نماذج اللغات الضخمة: كيف تختار الأفضل بذكاء! 🚀
أبحاث

تعزيز كفاءة نماذج اللغات الضخمة: كيف تختار الأفضل بذكاء! 🚀

أركايف للذكاءمنذ 3 شهر
ثورة في تصميم العمارة البرمجية: كيف تسهم مجموعة من الوكلاء الذكيين في إحداث تغيير حقيقي؟
أبحاث

ثورة في تصميم العمارة البرمجية: كيف تسهم مجموعة من الوكلاء الذكيين في إحداث تغيير حقيقي؟

أركايف للذكاءمنذ 3 شهر
ثورة جديدة في تقييم توليد الوجوه المتحدثة بواسطة الصوت: تقييم متوازن زمنياً
أبحاث

ثورة جديدة في تقييم توليد الوجوه المتحدثة بواسطة الصوت: تقييم متوازن زمنياً

أركايف للذكاءمنذ 3 شهر
👁 1
اكتشافات مثيرة في دقة واستقرار نماذج اللغات الضخمة في المهام البرمجية
نماذج لغوية

اكتشافات مثيرة في دقة واستقرار نماذج اللغات الضخمة في المهام البرمجية

أركايف للذكاءمنذ 3 شهر
👁 1
GenPT: ثورة جديدة في علم النفس باستخدام الفحص الاستدلالي الديناميكي!
أبحاث

GenPT: ثورة جديدة في علم النفس باستخدام الفحص الاستدلالي الديناميكي!

أركايف للذكاءمنذ 3 شهر
👁 1
إطار عمل مبتكر لتقييم موثوقية نماذج الذكاء الاصطناعي في الرعاية الصحية!
أبحاث

إطار عمل مبتكر لتقييم موثوقية نماذج الذكاء الاصطناعي في الرعاية الصحية!

أركايف للذكاءمنذ 3 شهر
👁 1
انطلاقة جديدة في تقييم الذكاء الاصطناعي: BADGER يجمع بين العوامل الديناميكية والتقييم المحدد في استدلال الأعمال
أبحاث

انطلاقة جديدة في تقييم الذكاء الاصطناعي: BADGER يجمع بين العوامل الديناميكية والتقييم المحدد في استدلال الأعمال

أركايف للذكاءمنذ 3 شهر
👁 1
قياس أداء التعلم المعزز: كيف يمكن للشهادات الذكية تغيير اللعبة؟
أبحاث

قياس أداء التعلم المعزز: كيف يمكن للشهادات الذكية تغيير اللعبة؟

أركايف للذكاءمنذ 3 شهر
👁 1