Ailoxa Logo

🏷️ #تقييم الأداء

167 مقال

اكتشاف معاناة وكالات البرمجة: كيف تتدهور الكودات مع SlopCodeBench
أبحاث

اكتشاف معاناة وكالات البرمجة: كيف تتدهور الكودات مع SlopCodeBench

أركايف للذكاءمنذ 2 شهر
👁 2
الحلول الدقيقة: الثقة في تقييمات وكلاء LLM التعاونية
أبحاث

الحلول الدقيقة: الثقة في تقييمات وكلاء LLM التعاونية

أركايف للذكاءمنذ 2 شهر
👁 1
اختبار حساسية النصوص: كيف تتفاعل نماذج الذكاء الاصطناعي مع لغات العالم المتعددة؟
أبحاث

اختبار حساسية النصوص: كيف تتفاعل نماذج الذكاء الاصطناعي مع لغات العالم المتعددة؟

أركايف للذكاءمنذ 2 شهر
👁 1
عندما تتوقف الأدلة المخزنة عن كونها قابلة للاستخدام: تقييم ذاكرة الوكيل في ظل نمو الأدلة
أبحاث

عندما تتوقف الأدلة المخزنة عن كونها قابلة للاستخدام: تقييم ذاكرة الوكيل في ظل نمو الأدلة

أركايف للذكاءمنذ 2 شهر
كيف تعاني نماذج اللغة والرؤية (VLMs) من ضعف الوعي بالخصوصية في العالم المادي؟
أبحاث

كيف تعاني نماذج اللغة والرؤية (VLMs) من ضعف الوعي بالخصوصية في العالم المادي؟

أركايف للذكاءمنذ 2 شهر
ثورة جديدة في علوم الحياة: تقديم BioAgent Bench لتقييم وكيل الذكاء الاصطناعي في المعلومات الحيوية
أبحاث

ثورة جديدة في علوم الحياة: تقديم BioAgent Bench لتقييم وكيل الذكاء الاصطناعي في المعلومات الحيوية

أركايف للذكاءمنذ 2 شهر
كيف تُعزز أنظمة الذكاء الاصطناعي تجربة التعلم؟ اكتشافات من 10,000 مشاركة طلابية
أبحاث

كيف تُعزز أنظمة الذكاء الاصطناعي تجربة التعلم؟ اكتشافات من 10,000 مشاركة طلابية

أركايف للذكاءمنذ 2 شهر
اختبار Vibe Code Bench: تقييم نماذج الذكاء الاصطناعي في تطوير تطبيقات الويب بشكل شامل!
أبحاث

اختبار Vibe Code Bench: تقييم نماذج الذكاء الاصطناعي في تطوير تطبيقات الويب بشكل شامل!

أركايف للذكاءمنذ 2 شهر
Workspace-Bench 1.0: انطلاقة جديدة في تقييم وكلاء الذكاء الاصطناعي في مهام العمل المعقدة
أبحاث

Workspace-Bench 1.0: انطلاقة جديدة في تقييم وكلاء الذكاء الاصطناعي في مهام العمل المعقدة

أركايف للذكاءمنذ 2 شهر
EngiBench: المعيار الثوري لتقييم نماذج اللغة الكبيرة في حل المشكلات الهندسية!
أبحاث

EngiBench: المعيار الثوري لتقييم نماذج اللغة الكبيرة في حل المشكلات الهندسية!

أركايف للذكاءمنذ 2 شهر
ثورة الذكاء الاصطناعي في الألعاب: تقييم محتوى لعبة الجري اللانهائي باستخدام وكلاء ذاتية
أبحاث

ثورة الذكاء الاصطناعي في الألعاب: تقييم محتوى لعبة الجري اللانهائي باستخدام وكلاء ذاتية

أركايف للذكاءمنذ 2 شهر
ثقة كبيرة في الذكاء الاصطناعي: كيف تؤثر طريقة التفكير على أداء نماذج اللغات الضخمة؟
أبحاث

ثقة كبيرة في الذكاء الاصطناعي: كيف تؤثر طريقة التفكير على أداء نماذج اللغات الضخمة؟

أركايف للذكاءمنذ 2 شهر
استراتيجيات مبتكرة لتحسين المساعدين الافتراضيين في التسوق عبر الذكاء الاصطناعي
روبوتات

استراتيجيات مبتكرة لتحسين المساعدين الافتراضيين في التسوق عبر الذكاء الاصطناعي

أركايف للذكاءمنذ 2 شهر
👁 1
كيف يفهم GPT-4o الرؤية؟ تقييم النماذج متعددة الوسائط في مهام الرؤية الحاسوبية
أبحاث

كيف يفهم GPT-4o الرؤية؟ تقييم النماذج متعددة الوسائط في مهام الرؤية الحاسوبية

أركايف للذكاءمنذ 2 شهر
تحديات تقييم نظام تحويل النصوص إلى استعلامات SQL: إطار عمل جديد يتجاوز الحدود التقليدية!
أدوات

تحديات تقييم نظام تحويل النصوص إلى استعلامات SQL: إطار عمل جديد يتجاوز الحدود التقليدية!

أركايف للذكاءمنذ 2 شهر
تحدي Claw-Eval-Live: معايير جديدة لتقييم وكيل الذكاء الاصطناعي في بيئات العمل الواقعية
أبحاث

تحدي Claw-Eval-Live: معايير جديدة لتقييم وكيل الذكاء الاصطناعي في بيئات العمل الواقعية

أركايف للذكاءمنذ 2 شهر
اكتشافات مذهلة في تقييم نماذج اللغات: تحليل تغيرات موثوقة بشكل غير مسبوق!
نماذج لغوية

اكتشافات مذهلة في تقييم نماذج اللغات: تحليل تغيرات موثوقة بشكل غير مسبوق!

أركايف للذكاءمنذ 2 شهر
معايير تقييم السلامة في المسارات لوكالة الذكاء الاصطناعي: اكتشفوا ATBench-Claw وATBench-Codex!
أبحاث

معايير تقييم السلامة في المسارات لوكالة الذكاء الاصطناعي: اكتشفوا ATBench-Claw وATBench-Codex!

أركايف للذكاءمنذ 2 شهر
CFDLLMBench: طراز جديد لتقييم نماذج اللغة الكبيرة في ديناميكا السوائل الحاسوبية
أبحاث

CFDLLMBench: طراز جديد لتقييم نماذج اللغة الكبيرة في ديناميكا السوائل الحاسوبية

أركايف للذكاءمنذ 2 شهر
👁 1
كيف تقيم أداء نماذج اللغات الضخمة في مراجعات الأدبيات؟ إليك التوصيات اللازمة!
أبحاث

كيف تقيم أداء نماذج اللغات الضخمة في مراجعات الأدبيات؟ إليك التوصيات اللازمة!

أركايف للذكاءمنذ 2 شهر