Ailoxa Logo

🏷️ #معايير تقييم

53 مقال

استكشف InvestPhilBench: المعيار الثوري لتقييم نماذج اللغات الكبيرة في فلسفة الاستثمار
أبحاث

استكشف InvestPhilBench: المعيار الثوري لتقييم نماذج اللغات الكبيرة في فلسفة الاستثمار

أركايف للذكاءمنذ 10 يوم
👁 1
تحليل جديد يكشف نقاط ضعف مثيرة في معايير تقييم البرمجة
أبحاث

تحليل جديد يكشف نقاط ضعف مثيرة في معايير تقييم البرمجة

مدونة أوبن إيه آيمنذ 11 يوم
تحديات الذكاء الاصطناعي: تقييم نماذج اللغة الضخمة ضمن تعقيدات البيانات الحقيقية
أبحاث

تحديات الذكاء الاصطناعي: تقييم نماذج اللغة الضخمة ضمن تعقيدات البيانات الحقيقية

أركايف للذكاءمنذ 12 يوم
👁 1
MMBench-Live: الثورة في تقييم النماذج متعددة الوسائط!
أبحاث

MMBench-Live: الثورة في تقييم النماذج متعددة الوسائط!

أركايف للذكاءمنذ 17 يوم
👁 4
التقييم الزمني للذكاء الاصطناعي في فيديوهات الطب: تعرف على MedStreamBench!
أبحاث

التقييم الزمني للذكاء الاصطناعي في فيديوهات الطب: تعرف على MedStreamBench!

أركايف للذكاءمنذ 17 يوم
👁 1
GameDevBench: تقييم قدرات الوكلاء في تطوير الألعاب!
أبحاث

GameDevBench: تقييم قدرات الوكلاء في تطوير الألعاب!

أركايف للذكاءمنذ 18 يوم
اكتشاف ثورة في الذكاء الاصطناعي مع EgoGapBench: معيار جديد لفهم الاختيار الإنساني في المشاهد متعددة الوكلاء!
أبحاث

اكتشاف ثورة في الذكاء الاصطناعي مع EgoGapBench: معيار جديد لفهم الاختيار الإنساني في المشاهد متعددة الوكلاء!

أركايف للذكاءمنذ 18 يوم
RigorBench: ثورة في قياس الانضباط العلمي لعملاء الذكاء الاصطناعي في البرمجة
أبحاث

RigorBench: ثورة في قياس الانضباط العلمي لعملاء الذكاء الاصطناعي في البرمجة

أركايف للذكاءمنذ 19 يوم
👁 1
MECoBench: طفرة جديدة في التعاون بين الوكلاء المُجسدين في بيئات متعددة الوسائط!
أبحاث

MECoBench: طفرة جديدة في التعاون بين الوكلاء المُجسدين في بيئات متعددة الوسائط!

أركايف للذكاءمنذ 19 يوم
DSH-Bench: معيار ثوري لتقييم توليد الصور من النصوص مع فهم عميق للموضوعات!
أبحاث

DSH-Bench: معيار ثوري لتقييم توليد الصور من النصوص مع فهم عميق للموضوعات!

أركايف للذكاءمنذ 19 يوم
👁 2
مؤشر جديد لكشف فشل نماذج الذكاء الاصطناعي في ضمان سلامة الرعاية الصحية!
أبحاث

مؤشر جديد لكشف فشل نماذج الذكاء الاصطناعي في ضمان سلامة الرعاية الصحية!

أركايف للذكاءمنذ 20 يوم
👁 1
سيرجفلا-بنش: أول معيار لتقييم نماذج الذكاء الاصطناعي في جراحة المنظار!
روبوتات

سيرجفلا-بنش: أول معيار لتقييم نماذج الذكاء الاصطناعي في جراحة المنظار!

أركايف للذكاءمنذ 20 يوم
إطلاق SciVisAgentBench: منصة متطورة لتقييم وكلاء تحليل البيانات العلمية!
أبحاث

إطلاق SciVisAgentBench: منصة متطورة لتقييم وكلاء تحليل البيانات العلمية!

أركايف للذكاءمنذ 20 يوم
👁 1
ثورة جديدة في أدوات الجداول: كيف تقيم "SpreadsheetBench 2" فهم الوكالات لعمليات الأعمال المعقدة؟
أدوات

ثورة جديدة في أدوات الجداول: كيف تقيم "SpreadsheetBench 2" فهم الوكالات لعمليات الأعمال المعقدة؟

أركايف للذكاءمنذ 20 يوم
👁 1
استكشاف أفق طويل: كيف يمكن نماذج اللغة متعددة الوسائط التنبؤ بالمشاهد من منظور ذاتي؟
أبحاث

استكشاف أفق طويل: كيف يمكن نماذج اللغة متعددة الوسائط التنبؤ بالمشاهد من منظور ذاتي؟

أركايف للذكاءمنذ 21 يوم
👁 1
تحقيق ثورة في توليد الصور: معايير جديدة ومكافآت ديناميكية تُعيد تشكيل المستقبل!
أبحاث

تحقيق ثورة في توليد الصور: معايير جديدة ومكافآت ديناميكية تُعيد تشكيل المستقبل!

أركايف للذكاءمنذ 24 يوم
👁 1
اختراق ثوري في تصنيف الصور الطبية: هل يمكن للنموذج الكمومي تحسين MRI الدماغ؟
أبحاث

اختراق ثوري في تصنيف الصور الطبية: هل يمكن للنموذج الكمومي تحسين MRI الدماغ؟

أركايف للذكاءمنذ 1 شهر
تعرف على SciRisk-Bench: معيار جديد لتقييم سلامة الذكاء الاصطناعي في الأبحاث العلمية!
أبحاث

تعرف على SciRisk-Bench: معيار جديد لتقييم سلامة الذكاء الاصطناعي في الأبحاث العلمية!

أركايف للذكاءمنذ 1 شهر
👁 1
إطلاق LifeSciBench: معيار جديد يقيس كفاءة نماذج الذكاء الاصطناعي في أبحاث الحياة الحقيقية!
أبحاث

إطلاق LifeSciBench: معيار جديد يقيس كفاءة نماذج الذكاء الاصطناعي في أبحاث الحياة الحقيقية!

مارك تيك بوستمنذ 1 شهر
EngTrace: معيار جديد لضمان دقة عمليات الهندسة المعقدة!
أبحاث

EngTrace: معيار جديد لضمان دقة عمليات الهندسة المعقدة!

أركايف للذكاءمنذ 1 شهر