🏷️ #تقييم
379 مقال
أبحاث
هل نستعد لعصر جديد من الذكاء الاصطناعي؟ استكشاف التحسين الذاتي المتكرر!
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
تقييم شامل لمخرجات نماذج اللغات الضخمة: نظام تصنيف متعدد العوامل
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة في تقييم أمان الذكاء الاصطناعي: مقياس جديد لقياس شدة الأفعال!
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة جديدة في الذكاء الاصطناعي: أداة RuBench للتقييم الذكي بلغة روسية!
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
إطار تقييم جديد للذكاء الاصطناعي: كيف يمكن لنماذج اللغات الضخمة إنتاج مصفوفات بنية التصميم؟
أركايف للذكاءمنذ 1 شهر
👁 1أبحاث
CSTutorBench: المعايير الثورية لتقييم نماذج الذكاء الاصطناعي كمعلمين في برمجة الكتل!
أركايف للذكاءمنذ 1 شهر
أبحاث
هل يمكن للذكاء الاصطناعي أن يقدم إجابات موثوقة؟ دراسة تكشف العلاقة بين نوع السؤال وموثوقية النماذج اللغوية!
أركايف للذكاءمنذ 1 شهر
روبوتات
RoboDojo: معيار ثوري لتقييم أداء الروبوتات في العالم الافتراضي والواقعي!
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة جديدة في تقييم الذكاء الاصطناعي: كيف يعمل BoRP على تحسين رضا المستخدمين؟
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
نموذج حواري مبتكر: تقييم تلقائي لحوارات الإرشاد باللغة اليابانية باستخدام الذكاء الاصطناعي
أركايف للذكاءمنذ 2 شهر
👁 2أبحاث
فجوة تقييم الذكاء الاصطناعي في السياسة الخارجية: تحديات جديدة أمام حكومات الذكاء الاصطناعي!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
تحديات وتوصيات لاستخدام نماذج الذكاء الاصطناعي كقضاة في التقييمات متعددة اللغات
أركايف للذكاءمنذ 2 شهر
أبحاث
AgenticDataBench: المرجع الشامل لوكلاء البيانات الثورية!
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
اختبار الطيران: معيار ثوري لتقييم نماذج الذكاء الاصطناعي في قطاع الطيران
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
دراسة جديدة تكشف: كيف تؤثر إطارات المطالبات على تقييم أداء نماذج الذكاء الاصطناعي في الكشف عن الأخطاء!
أركايف للذكاءمنذ 2 شهر
👁 1نماذج لغوية
ثورة جديدة في فهم الملفات المكتبية: اختبار Office Comprehension Benchmark!
أركايف للذكاءمنذ 2 شهر
أبحاث
سيفورا: إطار تقييم التعليقات ودعم الكتابة للطلاب باستخدام الذكاء الاصطناعي
أركايف للذكاءمنذ 2 شهر
👁 1أبحاث
MindEdit-Bench: معيار جديد لتقييم قدرة نماذج اللغة والرؤية على التفكير المكاني النقدي
أركايف للذكاءمنذ 2 شهر
أبحاث
ثورة في تقنيات التعلم غير المحدود: تقييم عملية النسيان في نماذج اللغة ذات الذاكرة المحدودة
أركايف للذكاءمنذ 2 شهر
أبحاث
AGI Maze: الإطار المثالي لتقييم وكالات نمذجة العالم!
أركايف للذكاءمنذ 2 شهر
👁 2