Ailoxa Logo

🏷️ #تقييم الذكاء الاصطناعي

95 مقال

تكنولوجيا جديدة تعزز دقة تقييم الذكاء الاصطناعي: تقنيات مبتكرة نحو محاكاة واقعية!
أبحاث

تكنولوجيا جديدة تعزز دقة تقييم الذكاء الاصطناعي: تقنيات مبتكرة نحو محاكاة واقعية!

أركايف للذكاءمنذ 18 ساعة
RENDER: السيطرة على تقييم الذاكرة في نماذج اللغات الضخمة!
أبحاث

RENDER: السيطرة على تقييم الذاكرة في نماذج اللغات الضخمة!

أركايف للذكاءمنذ 8 يوم
👁 1
تقييم نماذج اللغات الضخمة: خارطة طريق مبتكرة نحو الفهم العميق
أبحاث

تقييم نماذج اللغات الضخمة: خارطة طريق مبتكرة نحو الفهم العميق

أركايف للذكاءمنذ 9 يوم
إطلاق TELEVAL: معيار جديد لتقييم نماذج اللغة المحكية في السيناريوهات التفاعلية الصينية
أبحاث

إطلاق TELEVAL: معيار جديد لتقييم نماذج اللغة المحكية في السيناريوهات التفاعلية الصينية

أركايف للذكاءمنذ 9 يوم
👁 3
لا حكم بدون سبب: تطوير نظام تقييم الذكاء الاصطناعي القائم على المقاييس المضادة
أبحاث

لا حكم بدون سبب: تطوير نظام تقييم الذكاء الاصطناعي القائم على المقاييس المضادة

أركايف للذكاءمنذ 10 يوم
👁 1
اكتشاف ثوري في تقييم نماذج اللغات الضخمة: Qworld ينقل معايير التقييم إلى آفاق جديدة!
أبحاث

اكتشاف ثوري في تقييم نماذج اللغات الضخمة: Qworld ينقل معايير التقييم إلى آفاق جديدة!

أركايف للذكاءمنذ 13 يوم
👁 1
هل تحدث ثورة في عالم نماذج اللغات؟ تعرفوا على RepBench لقياس القدرات بدقة مذهلة!
نماذج لغوية

هل تحدث ثورة في عالم نماذج اللغات؟ تعرفوا على RepBench لقياس القدرات بدقة مذهلة!

أركايف للذكاءمنذ 17 يوم
تسوغو: خطوة ثورية في تقييم كفاءة البحث في نماذج الذكاء الاصطناعي من خلال تحديات الحياة والموت في لعبة Go
أبحاث

تسوغو: خطوة ثورية في تقييم كفاءة البحث في نماذج الذكاء الاصطناعي من خلال تحديات الحياة والموت في لعبة Go

أركايف للذكاءمنذ 20 يوم
👁 2
تقييم فعالية القواعد الناتجة عن نماذج اللغات الضخمة في الأمن السيبراني
أبحاث

تقييم فعالية القواعد الناتجة عن نماذج اللغات الضخمة في الأمن السيبراني

أركايف للذكاءمنذ 21 يوم
دراسة جديدة تكشف مفاجآت حول دقة نماذج الذكاء الاصطناعي وتأثير ترتيب الخيارات!
أبحاث

دراسة جديدة تكشف مفاجآت حول دقة نماذج الذكاء الاصطناعي وتأثير ترتيب الخيارات!

أركايف للذكاءمنذ 21 يوم
ثورة الذكاء الاصطناعي: الكشف عن Apodex Discovery لتقييم التكنولوجيا المتقدمة!
أبحاث

ثورة الذكاء الاصطناعي: الكشف عن Apodex Discovery لتقييم التكنولوجيا المتقدمة!

أركايف للذكاءمنذ 21 يوم
خطوة نحو معيار حقوق الإنسان لنماذج اللغات الضخمة: منهجية مبتكرة للتقييم
أبحاث

خطوة نحو معيار حقوق الإنسان لنماذج اللغات الضخمة: منهجية مبتكرة للتقييم

أركايف للذكاءمنذ 22 يوم
Autorubric: الإطار الثوري لتقييم نماذج الذكاء الاصطناعي في المهام غير القابلة للتحقق
أبحاث

Autorubric: الإطار الثوري لتقييم نماذج الذكاء الاصطناعي في المهام غير القابلة للتحقق

أركايف للذكاءمنذ 23 يوم
👁 2
تحديات الزمن: مقارنة نماذج اللغة الضخمة في فهم الوثائق المتطورة
أبحاث

تحديات الزمن: مقارنة نماذج اللغة الضخمة في فهم الوثائق المتطورة

أركايف للذكاءمنذ 23 يوم
👁 3
ثورة في تقييم الذكاء الاصطناعي: لماذا يجب قياس تكلفة التحقق بدلاً من الدقة فقط؟
أبحاث

ثورة في تقييم الذكاء الاصطناعي: لماذا يجب قياس تكلفة التحقق بدلاً من الدقة فقط؟

أركايف للذكاءمنذ 23 يوم
تقديم المحرك الشامل لتدقيق الوكلاء: الأداة الثورية لتقييم نماذج الذكاء الاصطناعي!
أدوات

تقديم المحرك الشامل لتدقيق الوكلاء: الأداة الثورية لتقييم نماذج الذكاء الاصطناعي!

أركايف للذكاءمنذ 24 يوم
👁 2
ثورة الذكاء الاصطناعي في البحث العلمي: خطوة جديدة نحو الاكتشافات الحقيقية!
أبحاث

ثورة الذكاء الاصطناعي في البحث العلمي: خطوة جديدة نحو الاكتشافات الحقيقية!

أركايف للذكاءمنذ 24 يوم
👁 1
إطلاق M3MAD-Bench: معيار ثوري لتقييم مناظرات الذكاء الاصطناعي عبر مجالات متعددة!
أبحاث

إطلاق M3MAD-Bench: معيار ثوري لتقييم مناظرات الذكاء الاصطناعي عبر مجالات متعددة!

أركايف للذكاءمنذ 1 شهر
👁 1
فخ الشكلية: هل تُعمي أنظمة LLM-as-a-Judge عن الحقيقة تحت ضغط التوافق الاجتماعي؟
أبحاث

فخ الشكلية: هل تُعمي أنظمة LLM-as-a-Judge عن الحقيقة تحت ضغط التوافق الاجتماعي؟

أركايف للذكاءمنذ 1 شهر
👁 1
تقنية جديدة في تحسين التفضيلات: نموذج DMAPO يدعو لتقليل البيانات وزيادة الدقة
أبحاث

تقنية جديدة في تحسين التفضيلات: نموذج DMAPO يدعو لتقليل البيانات وزيادة الدقة

أركايف للذكاءمنذ 1 شهر
👁 1