Ailoxa Logo

🏷️ #تقييم

379 مقال

EComAgentBench: ثورة في تقييم وكالات التسوق الذكي عبر مهام طويلة الأمد!
أبحاث

EComAgentBench: ثورة في تقييم وكالات التسوق الذكي عبر مهام طويلة الأمد!

أركايف للذكاءمنذ 2 شهر
👁 1
استخدام نماذج لغوية ضخمة كقضاة في التعليم: مسار تقييم يعتمد على المناهج الدراسية
أبحاث

استخدام نماذج لغوية ضخمة كقضاة في التعليم: مسار تقييم يعتمد على المناهج الدراسية

أركايف للذكاءمنذ 2 شهر
SEAGym: بيئة تقييم مبتكرة لوكلاء LLM القابلين للتطور الذاتي
أبحاث

SEAGym: بيئة تقييم مبتكرة لوكلاء LLM القابلين للتطور الذاتي

أركايف للذكاءمنذ 2 شهر
DeepInsight: ثورة في تقييم مجموعات الذكاء الاصطناعي المدمجة
أبحاث

DeepInsight: ثورة في تقييم مجموعات الذكاء الاصطناعي المدمجة

أركايف للذكاءمنذ 2 شهر
AuAu: معيار جديد لتقييم تحيزات الأنظمة اللغوية نحو الاستبداد!
أخلاقيات الذكاء الاصطناعي

AuAu: معيار جديد لتقييم تحيزات الأنظمة اللغوية نحو الاستبداد!

أركايف للذكاءمنذ 2 شهر
👁 1
اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!
أبحاث

اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
تجاوز الصواب: تعزيز الفهم المعماري في نماذج البرمجة عبر تقييم متدرج مع حكم آلي
نماذج لغوية

تجاوز الصواب: تعزيز الفهم المعماري في نماذج البرمجة عبر تقييم متدرج مع حكم آلي

أركايف للذكاءمنذ 2 شهر
نموذج الذكاء الاصطناعي: تقييم أولي لنقاط المخطوطات ودقتها في تقديم نتائج مراجعة الأقران!
أبحاث

نموذج الذكاء الاصطناعي: تقييم أولي لنقاط المخطوطات ودقتها في تقديم نتائج مراجعة الأقران!

أركايف للذكاءمنذ 2 شهر
👁 1
إطار عمل استرجاع Agents للقيام بتقييم جودة البيانات بشكل مستقل وذكي
أبحاث

إطار عمل استرجاع Agents للقيام بتقييم جودة البيانات بشكل مستقل وذكي

أركايف للذكاءمنذ 2 شهر
👁 1
تمثيل يومي: كيفية تقييم وكلاء البحث في مهام البحث اليومية بذكاء متطور!
أبحاث

تمثيل يومي: كيفية تقييم وكلاء البحث في مهام البحث اليومية بذكاء متطور!

أركايف للذكاءمنذ 2 شهر
تطوير ثوري في تقييم الصحة النفسية: استراتيجيات جديدة تعتمد على الذكاء الاصطناعي
أبحاث

تطوير ثوري في تقييم الصحة النفسية: استراتيجيات جديدة تعتمد على الذكاء الاصطناعي

أركايف للذكاءمنذ 2 شهر
CMI-RewardBench: ثورة في تقييم نماذج مكافآت الموسيقى من خلال التعليمات المتعددة الوسائط
أبحاث

CMI-RewardBench: ثورة في تقييم نماذج مكافآت الموسيقى من خلال التعليمات المتعددة الوسائط

أركايف للذكاءمنذ 2 شهر
👁 1
ثورة جديدة في تقييم ذكاء الآلات: استراتيجيات مبتكرة لقياس التفكير الإجرائي!
أبحاث

ثورة جديدة في تقييم ذكاء الآلات: استراتيجيات مبتكرة لقياس التفكير الإجرائي!

أركايف للذكاءمنذ 2 شهر
WildIFEval: ثورة في فهم التعليمات المعقدة للذكاء الاصطناعي!
أبحاث

WildIFEval: ثورة في فهم التعليمات المعقدة للذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
تقييم مخصص للذكاء الاصطناعي: كيف نتنبأ بمخاطر رفض استجابات نموذج اللغة الطبية؟
أبحاث

تقييم مخصص للذكاء الاصطناعي: كيف نتنبأ بمخاطر رفض استجابات نموذج اللغة الطبية؟

أركايف للذكاءمنذ 2 شهر
👁 1
مقياس MobilityBench: معيار جديد لتقييم وكلاء تخطيط الطرق في سيناريوهات التنقل الواقعية
أبحاث

مقياس MobilityBench: معيار جديد لتقييم وكلاء تخطيط الطرق في سيناريوهات التنقل الواقعية

أركايف للذكاءمنذ 2 شهر
ابتكار آلي: تقييم إبداع نماذج اللغة عبر مهام مفتوحة بشكل ثوري!
أبحاث

ابتكار آلي: تقييم إبداع نماذج اللغة عبر مهام مفتوحة بشكل ثوري!

أركايف للذكاءمنذ 2 شهر
اكتشاف إمكانيات جديدة في الذكاء الاصطناعي مع نظام Embodied-BenchClaw الثوري!
أبحاث

اكتشاف إمكانيات جديدة في الذكاء الاصطناعي مع نظام Embodied-BenchClaw الثوري!

أركايف للذكاءمنذ 2 شهر
إطلاق IntElicit: إطار مبتكر لتقييم الإبداع في بيئة الحوار المتفاعل!
أبحاث

إطلاق IntElicit: إطار مبتكر لتقييم الإبداع في بيئة الحوار المتفاعل!

أركايف للذكاءمنذ 2 شهر
تحقيق الانتصار في أبحاث الذكاء الاصطناعي: كيفية تحسين قرارات الوكالات البحثية
أبحاث

تحقيق الانتصار في أبحاث الذكاء الاصطناعي: كيفية تحسين قرارات الوكالات البحثية

أركايف للذكاءمنذ 2 شهر