Ailoxa Logo

🏷️ #تقييم الأداء

247 مقال

ثورة في قياس ضغط الدم: طريقة جديدة تعتمد على الكشف عن نقاط التغيير!
أبحاث

ثورة في قياس ضغط الدم: طريقة جديدة تعتمد على الكشف عن نقاط التغيير!

أركايف للذكاءمنذ 15 يوم
هل يمكن للمعيار أن يكتب نفسه؟ تطور مثير في الذكاء الاصطناعي
أبحاث

هل يمكن للمعيار أن يكتب نفسه؟ تطور مثير في الذكاء الاصطناعي

أركايف للذكاءمنذ 15 يوم
👁 1
ثورة في إنتاج الفيديو: تعرف على SemComp-Bench لتقييم فهم المهام الدلالية
أبحاث

ثورة في إنتاج الفيديو: تعرف على SemComp-Bench لتقييم فهم المهام الدلالية

أركايف للذكاءمنذ 16 يوم
👁 2
التطور الثوري: DeepInsight II ينقل الذكاء الاصطناعي من التجارب إلى الروبوتات!
روبوتات

التطور الثوري: DeepInsight II ينقل الذكاء الاصطناعي من التجارب إلى الروبوتات!

أركايف للذكاءمنذ 17 يوم
نحو بزوغ عصر جديد في تقييم سلوك النماذج اللغوية: كيف يمكن لتحليل الخيارات المتاحة أن يحدث ثورة في المعايير القانونية؟
أبحاث

نحو بزوغ عصر جديد في تقييم سلوك النماذج اللغوية: كيف يمكن لتحليل الخيارات المتاحة أن يحدث ثورة في المعايير القانونية؟

أركايف للذكاءمنذ 17 يوم
👁 2
استكشاف تناسق السلوك عبر المهام في نماذج اللغة: مقياس جديد يُحدث ثورة في تقييم الوكلاء
أبحاث

استكشاف تناسق السلوك عبر المهام في نماذج اللغة: مقياس جديد يُحدث ثورة في تقييم الوكلاء

أركايف للذكاءمنذ 18 يوم
👁 1
تعزيز موثوقية وكلاء البرمجة: كيف يمكن تقييم وتحسين الأنظمة المحيطة بالنموذج؟
أبحاث

تعزيز موثوقية وكلاء البرمجة: كيف يمكن تقييم وتحسين الأنظمة المحيطة بالنموذج؟

أركايف للذكاءمنذ 18 يوم
👁 2
تحذير: لا تعتقد أن تحسين النماذج وفقاً لمعايير الأداء يوفر قدرات ترميز شاملة!
أبحاث

تحذير: لا تعتقد أن تحسين النماذج وفقاً لمعايير الأداء يوفر قدرات ترميز شاملة!

أركايف للذكاءمنذ 18 يوم
👁 1
كشف النقاب عن WitnessSim: ثورة في محاكاة الشهادات القانونية عبر الذكاء الاصطناعي
أبحاث

كشف النقاب عن WitnessSim: ثورة في محاكاة الشهادات القانونية عبر الذكاء الاصطناعي

أركايف للذكاءمنذ 18 يوم
👁 2
تقييم منهجي للذكاء الاصطناعي: كيف يتجاوز الأداء النهائي ويحقق نتائج أفضل؟
أبحاث

تقييم منهجي للذكاء الاصطناعي: كيف يتجاوز الأداء النهائي ويحقق نتائج أفضل؟

أركايف للذكاءمنذ 21 يوم
👁 1
تحليل قوة أداء GraphRAG: تقييم غير متحيز يكشف الحقيقة!
أبحاث

تحليل قوة أداء GraphRAG: تقييم غير متحيز يكشف الحقيقة!

أركايف للذكاءمنذ 21 يوم
👁 2
إعداد الواجهة التفاعلية: إطار جديد لتقييم وكالات الذكاء الاصطناعي في الأدوار البشرية
أبحاث

إعداد الواجهة التفاعلية: إطار جديد لتقييم وكالات الذكاء الاصطناعي في الأدوار البشرية

أركايف للذكاءمنذ 21 يوم
كشف النقاب عن سلوك نماذج الرؤية واللغة عند ضعف الرؤية: دراسة فريدة لمؤشرات سلوك VLMs
أبحاث

كشف النقاب عن سلوك نماذج الرؤية واللغة عند ضعف الرؤية: دراسة فريدة لمؤشرات سلوك VLMs

أركايف للذكاءمنذ 21 يوم
👁 1
هل ترى ما ترسم؟ إطار عمل مغلق لتقييم شامل لنماذج متعددة الوسائط الموحدة
أبحاث

هل ترى ما ترسم؟ إطار عمل مغلق لتقييم شامل لنماذج متعددة الوسائط الموحدة

أركايف للذكاءمنذ 22 يوم
تأثير صيغ الكلمات: قياس انزلاق أدائي نموذج اللغة الكبير في التقييمات
أبحاث

تأثير صيغ الكلمات: قياس انزلاق أدائي نموذج اللغة الكبير في التقييمات

أركايف للذكاءمنذ 22 يوم
👁 1
إطلاق InfraBench: ثورة جديدة في تقييم وكلاء البنية التحتية الذكية!
أبحاث

إطلاق InfraBench: ثورة جديدة في تقييم وكلاء البنية التحتية الذكية!

أركايف للذكاءمنذ 22 يوم
👁 1
تقييم قدرات وكلاء الذكاء الاصطناعي في عمليات الاتصالات: CTBench يتصدر المشهد!
أبحاث

تقييم قدرات وكلاء الذكاء الاصطناعي في عمليات الاتصالات: CTBench يتصدر المشهد!

أركايف للذكاءمنذ 22 يوم
👁 2
ReXrank: تصنيف رائد عالمي لتوليد تقارير الأشعة باستخدام الذكاء الاصطناعي!
أبحاث

ReXrank: تصنيف رائد عالمي لتوليد تقارير الأشعة باستخدام الذكاء الاصطناعي!

أركايف للذكاءمنذ 22 يوم
👁 1
فحص السلامة في نماذج الذكاء الاصطناعي: كيف تفشل القواعد في الحفاظ على الأمان؟
أبحاث

فحص السلامة في نماذج الذكاء الاصطناعي: كيف تفشل القواعد في الحفاظ على الأمان؟

أركايف للذكاءمنذ 22 يوم
TRACE Bench: ثورة في تقييم الأداء التفاعلي مع وكيل الدردشة!
أبحاث

TRACE Bench: ثورة في تقييم الأداء التفاعلي مع وكيل الدردشة!

أركايف للذكاءمنذ 22 يوم
👁 2