🏷️ #تقييم
275 مقال
أبحاث
ثورة في علم الأحياء: تقييم الكيانات الحيوية بمساعدة الذكاء الاصطناعي
أركايف للذكاءمنذ 1 شهر
👁 2أبحاث
إطار تقييم قائم على الشخصيات لتحقيق التوافق المتعدد في الذكاء الاصطناعي التوليدي
أركايف للذكاءمنذ 1 شهر
👁 1نماذج لغوية
TRACE: تقييم عملية التفكير المنطقي في نماذج اللغة الكبيرة بطريقة جديدة!
أركايف للذكاءمنذ 1 شهر
أبحاث
JMed48k: المعيار الثوري لاختبار الترخيص الطبي في اليابان يقيّم نماذج الرؤية واللغة
أركايف للذكاءمنذ 1 شهر
أبحاث
قياس تمكين وكلاء نماذج اللغة: كيف يسهم الذكاء الاصطناعي في تعزيز الأداء الفعّال؟
أركايف للذكاءمنذ 1 شهر
أبحاث
SCDBench: معيار ثوري لفحص أدوات فك تجميع العقود الذكية المدعومة بالذكاء الاصطناعي
أركايف للذكاءمنذ 1 شهر
أبحاث
مغامرات العقل: ساحة جديدة لتقييم التفكير الاجتماعي والاستراتيجي في نماذج اللغة المتعددة العملاء!
أركايف للذكاءمنذ 1 شهر
أدوات
إطار RAGe: ثورة في تقييم تطبيقات الذكاء الاصطناعي المعززة بالاسترجاع
أركايف للذكاءمنذ 1 شهر
أخلاقيات الذكاء الاصطناعي
كيف تعيد الذكاء الاصطناعي تشكيل التعليم العالي؟ نموذج رياضي لفهم الاستخدام الأخلاقي!
أركايف للذكاءمنذ 1 شهر
أبحاث
ابتكار إطار موحد لتقييم قدرات الوكلاء في نماذج اللغات الضخمة
أركايف للذكاءمنذ 1 شهر
أبحاث
MIRA: معايير مبتكرة لتحسين دقة المعلومات الطبية عبر اللغات
أركايف للذكاءمنذ 1 شهر
أبحاث
معيار جديد لتقييم أنظمة الذكاء الاصطناعي! استكشف كيف يتم قياس كفاءة نماذج اللغات الضخمة كحكام
أركايف للذكاءمنذ 1 شهر
أخلاقيات الذكاء الاصطناعي
لماذا يجب على مجتمع الذكاء الاصطناعي التخلي عن مصطلح "الباب الخلفي الإيجابي"؟
أركايف للذكاءمنذ 1 شهر
أبحاث
استراتيجيات مبتكرة لتقييم الملخصات البحثية المُولّدة: كيف ستكون المستقبل!
أركايف للذكاءمنذ 1 شهر
أبحاث
فجوة المراقبة والتحكم: لماذا لا تكفي نماذج الذكاء الاصطناعي لاستجابة فعالة
أركايف للذكاءمنذ 1 شهر
أبحاث
RepoMirage: هل يمكن لوكلاء البرمجيات فهم سياق المستودعات البرمجية؟
أركايف للذكاءمنذ 1 شهر
أبحاث
Verus-SpecGym: بيئة مبتكرة لتقييم تحويل المواصفات بدقة!
أركايف للذكاءمنذ 1 شهر
أبحاث
TowerMind: بيئة جديدة للألعاب الدفاعية تثبت قوة نماذج اللغات الكبيرة كعملاء ذكيين!
أركايف للذكاءمنذ 1 شهر
أبحاث
ثورة جديدة في الذكاء الاصطناعي: تقييم واقعية الفيزياء في نماذج الفيديو من النصوص!
أركايف للذكاءمنذ 1 شهر
أبحاث
كشف النقاب عن ChaosBench-Logic v2: تقييم تفكير LLMs في الأنظمة الديناميكية
أركايف للذكاءمنذ 1 شهر
