Ailoxa Logo

🏷️ #تقييم أداء

18 مقال

اكتشف HANDBOOK.md: معيار جديد لقياس أداء نماذج الذكاء الاصطناعي في اتباع التعليمات المطوّلة!
أبحاث

اكتشف HANDBOOK.md: معيار جديد لقياس أداء نماذج الذكاء الاصطناعي في اتباع التعليمات المطوّلة!

أركايف للذكاءمنذ 1 يوم
👁 1
إطلاق ARCO: ثورة جديدة في تقييم أداء وكلاء الذكاء الاصطناعي!
أبحاث

إطلاق ARCO: ثورة جديدة في تقييم أداء وكلاء الذكاء الاصطناعي!

أركايف للذكاءمنذ 6 يوم
اكتشاف SenWorld: ثورة في تقييم المساعدين الشخصيين من خلال محاكاة رقمية مبتكرة!
أبحاث

اكتشاف SenWorld: ثورة في تقييم المساعدين الشخصيين من خلال محاكاة رقمية مبتكرة!

أركايف للذكاءمنذ 7 يوم
👁 1
اختيار مجموعات الموجهات دون إشراف: استراتيجيات جديدة لقياس أداء نماذج اللغات الضخمة!
أبحاث

اختيار مجموعات الموجهات دون إشراف: استراتيجيات جديدة لقياس أداء نماذج اللغات الضخمة!

أركايف للذكاءمنذ 16 يوم
👁 3
تحديات جديدة أمام نماذج التعلم العميق: MultiView-Bench يكشف عن عوائق دمج المشاهد المتعددة!
أبحاث

تحديات جديدة أمام نماذج التعلم العميق: MultiView-Bench يكشف عن عوائق دمج المشاهد المتعددة!

أركايف للذكاءمنذ 17 يوم
👁 1
ثورة جديدة في نماذج اللغة: استكشاف صعوبة المهام الطويلة عبر معيار PredicateLongBench!
نماذج لغوية

ثورة جديدة في نماذج اللغة: استكشاف صعوبة المهام الطويلة عبر معيار PredicateLongBench!

أركايف للذكاءمنذ 20 يوم
👁 2
هل تفشل نماذج اللغة الكبيرة؟ اكتشافات مثيرة حول عيوب الأداء في الوكلاء الذكيين!
أبحاث

هل تفشل نماذج اللغة الكبيرة؟ اكتشافات مثيرة حول عيوب الأداء في الوكلاء الذكيين!

أركايف للذكاءمنذ 22 يوم
اكتشفوا قوة التفاعل الاجتماعي في نماذج الذكاء الاصطناعي من خلال SocialOmni!
أبحاث

اكتشفوا قوة التفاعل الاجتماعي في نماذج الذكاء الاصطناعي من خلال SocialOmni!

أركايف للذكاءمنذ 28 يوم
هل أنت مستعد لاكتشاف تصنيفات FFASR لمقياس دقة التعرف الصوتي؟
أبحاث

هل أنت مستعد لاكتشاف تصنيفات FFASR لمقياس دقة التعرف الصوتي؟

هاجينج فيسمنذ 1 شهر
منصة TW-LegalBench: ثورة في قياس الفهم القانوني التايواني باستخدام الذكاء الاصطناعي
أبحاث

منصة TW-LegalBench: ثورة في قياس الفهم القانوني التايواني باستخدام الذكاء الاصطناعي

أركايف للذكاءمنذ 1 شهر
EpiBench: معيار جديد لتقييم وكالات الذكاء الاصطناعي في تحليل الإيبيجينيوم
أبحاث

EpiBench: معيار جديد لتقييم وكالات الذكاء الاصطناعي في تحليل الإيبيجينيوم

أركايف للذكاءمنذ 1 شهر
الكشف عن فجوات الكفاءة في نماذج اللغات الضخمة: هل تنجح المعايير القياسية؟
أبحاث

الكشف عن فجوات الكفاءة في نماذج اللغات الضخمة: هل تنجح المعايير القياسية؟

أركايف للذكاءمنذ 1 شهر
👁 1
اكتشف السر وراء أداء نماذج الذكاء الاصطناعي: هل تعتمد على العوامل الخارجية أكثر من النموذج نفسه؟
أبحاث

اكتشف السر وراء أداء نماذج الذكاء الاصطناعي: هل تعتمد على العوامل الخارجية أكثر من النموذج نفسه؟

أركايف للذكاءمنذ 2 شهر
تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!
أبحاث

تفكيك كفاءة التفكير في نماذج لغوية ضخمة: ما وراء دقة النتائج!

أركايف للذكاءمنذ 2 شهر
استكشاف متقدمة مراقبة المعرفة الذاتية في نماذج الذكاء الاصطناعي: معجم يحوي 33 نموذجاً ثورياً
أبحاث

استكشاف متقدمة مراقبة المعرفة الذاتية في نماذج الذكاء الاصطناعي: معجم يحوي 33 نموذجاً ثورياً

أركايف للذكاءمنذ 2 شهر
تحليل متعمق: تقييم شديد الدقة لأنظمة الإجابة على الأسئلة الطبية وتأثيراتها على العدالة الصحية
أبحاث

تحليل متعمق: تقييم شديد الدقة لأنظمة الإجابة على الأسئلة الطبية وتأثيراتها على العدالة الصحية

أركايف للذكاءمنذ 3 شهر
معيار مبتكر لتقييم وكلاء الويب في مجالات التجارة الإلكترونية: نحو مستقبل أفضل!
أبحاث

معيار مبتكر لتقييم وكلاء الويب في مجالات التجارة الإلكترونية: نحو مستقبل أفضل!

أركايف للذكاءمنذ 3 شهر
استكشاف ثوري في تطوير نوى معالجة الذكاء الاصطناعي: آليات AscendKernelGen تتجاوز التحديات!
أبحاث

استكشاف ثوري في تطوير نوى معالجة الذكاء الاصطناعي: آليات AscendKernelGen تتجاوز التحديات!

أركايف للذكاءمنذ 3 شهر