Ailoxa Logo

🏷️ #تقييم

274 مقال

إعادة التفكير في تقييم دور اللعب: تقنيات جديدة لتجاوز قيود الشخصية
أبحاث

إعادة التفكير في تقييم دور اللعب: تقنيات جديدة لتجاوز قيود الشخصية

أركايف للذكاءمنذ 21 يوم
هل يمكن للذكاء الاصطناعي تقييم الإبداع البشري؟ تعرف على معيار الإبداع البشري!
أبحاث

هل يمكن للذكاء الاصطناعي تقييم الإبداع البشري؟ تعرف على معيار الإبداع البشري!

أركايف للذكاءمنذ 21 يوم
👁 1
تطور جديد في أمان نماذج الذكاء الاصطناعي: Introducing CASE-Bench!
أبحاث

تطور جديد في أمان نماذج الذكاء الاصطناعي: Introducing CASE-Bench!

أركايف للذكاءمنذ 21 يوم
DMind Benchmark: تقييم شامل لجهود نماذج اللغات الضخمة في عالم Web3
أبحاث

DMind Benchmark: تقييم شامل لجهود نماذج اللغات الضخمة في عالم Web3

أركايف للذكاءمنذ 22 يوم
👁 1
استخدم الأسئلة الثنائية لتحسين تقييم نماذج اللغات الضخمة: المشروع الثوري BINEVAL!
أبحاث

استخدم الأسئلة الثنائية لتحسين تقييم نماذج اللغات الضخمة: المشروع الثوري BINEVAL!

أركايف للذكاءمنذ 25 يوم
👁 1
WatchAct: الثورية في تقييم سلوك الروبوتات وطرق التلاعب
روبوتات

WatchAct: الثورية في تقييم سلوك الروبوتات وطرق التلاعب

أركايف للذكاءمنذ 25 يوم
👁 1
scBench-Long: الثورة في تقييمات علم الأحياء الخلوية على المدى الطويل!
أبحاث

scBench-Long: الثورة في تقييمات علم الأحياء الخلوية على المدى الطويل!

أركايف للذكاءمنذ 25 يوم
👁 1
تقييم مبتكر لتحسين توصيات الذكاء الاصطناعي لنماذج لغوية حول مرض السكري من النوع الثاني!
أبحاث

تقييم مبتكر لتحسين توصيات الذكاء الاصطناعي لنماذج لغوية حول مرض السكري من النوع الثاني!

أركايف للذكاءمنذ 27 يوم
👁 1
كسر المرآة: التخفيف من انحياز التفضيل الذاتي في نماذج اللغة الكبيرة
أبحاث

كسر المرآة: التخفيف من انحياز التفضيل الذاتي في نماذج اللغة الكبيرة

أركايف للذكاءمنذ 27 يوم
اكتشف درجاتك في الذكاء الاصطناعي مع إين ذا وييتس! 📊
أدوات

اكتشف درجاتك في الذكاء الاصطناعي مع إين ذا وييتس! 📊

تيك كرانشمنذ 1 شهر
👁 2
AURA: ابتكار ثوري في تصحيح قاضي الذكاء الاصطناعي من خلال فحص عدم اليقين
أبحاث

AURA: ابتكار ثوري في تصحيح قاضي الذكاء الاصطناعي من خلال فحص عدم اليقين

أركايف للذكاءمنذ 1 شهر
ثورة في تقييم نماذج اللغة: QMFOL تعيد تعريف المنطق الاستدلالي!
أبحاث

ثورة في تقييم نماذج اللغة: QMFOL تعيد تعريف المنطق الاستدلالي!

أركايف للذكاءمنذ 1 شهر
👁 1
شاهد كيف تغير RTSGameBench طريقة تقييم الذكاء الاستراتيجي في الألعاب!
أبحاث

شاهد كيف تغير RTSGameBench طريقة تقييم الذكاء الاستراتيجي في الألعاب!

أركايف للذكاءمنذ 1 شهر
👁 1
ثورة في تقييم الملاحظات المجتمعية: نموذج متعدد الوكلاء يغيّر قواعد اللعبة!
أبحاث

ثورة في تقييم الملاحظات المجتمعية: نموذج متعدد الوكلاء يغيّر قواعد اللعبة!

أركايف للذكاءمنذ 1 شهر
WebSP-Eval: ثورة جديدة في تقييم أداء الوكلاء عبر الإنترنت في مهام الأمان والخصوصية!
أبحاث

WebSP-Eval: ثورة جديدة في تقييم أداء الوكلاء عبر الإنترنت في مهام الأمان والخصوصية!

أركايف للذكاءمنذ 1 شهر
استخدام نماذج لغوية ضخمة كقضاة في التعليم: مسار تقييم يعتمد على المناهج الدراسية
أبحاث

استخدام نماذج لغوية ضخمة كقضاة في التعليم: مسار تقييم يعتمد على المناهج الدراسية

أركايف للذكاءمنذ 1 شهر
SEAGym: بيئة تقييم مبتكرة لوكلاء LLM القابلين للتطور الذاتي
أبحاث

SEAGym: بيئة تقييم مبتكرة لوكلاء LLM القابلين للتطور الذاتي

أركايف للذكاءمنذ 1 شهر
DeepInsight: ثورة في تقييم مجموعات الذكاء الاصطناعي المدمجة
أبحاث

DeepInsight: ثورة في تقييم مجموعات الذكاء الاصطناعي المدمجة

أركايف للذكاءمنذ 1 شهر
EComAgentBench: ثورة في تقييم وكالات التسوق الذكي عبر مهام طويلة الأمد!
أبحاث

EComAgentBench: ثورة في تقييم وكالات التسوق الذكي عبر مهام طويلة الأمد!

أركايف للذكاءمنذ 1 شهر
اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!
أبحاث

اكتشاف Mask-Proof: ثورة جديدة في تقييم إثباتات الرياضيات باستخدام نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر