Ailoxa Logo

🏷️ #Benchmarking

26 مقال

RAGMark: إطار شامل لقياس أنظمة الإنتاج المدعومة بالت retrieval!
أبحاث

RAGMark: إطار شامل لقياس أنظمة الإنتاج المدعومة بالت retrieval!

أركايف للذكاءمنذ 4 يوم
👁 4
محرك Qiushi: ثورة جديدة في اختبار الأداء للذكاء الاصطناعي!
أبحاث

محرك Qiushi: ثورة جديدة في اختبار الأداء للذكاء الاصطناعي!

أركايف للذكاءمنذ 4 يوم
ابتكار ثوري: APIFlow-Bench لقياس أداء الوكلاء في العمل مع واجهات برمجة التطبيقات!
أبحاث

ابتكار ثوري: APIFlow-Bench لقياس أداء الوكلاء في العمل مع واجهات برمجة التطبيقات!

أركايف للذكاءمنذ 13 يوم
👁 1
MobilePA-Bench: ثورة جديدة في تقييم وكيل التخطيط المحمول!
أبحاث

MobilePA-Bench: ثورة جديدة في تقييم وكيل التخطيط المحمول!

أركايف للذكاءمنذ 20 يوم
👁 1
هل تأتي التوحيد بتكلفة؟ اكتشفوا Uni-SafeBench كمعيار أمان لنماذج متعددة الوظائف!
أبحاث

هل تأتي التوحيد بتكلفة؟ اكتشفوا Uni-SafeBench كمعيار أمان لنماذج متعددة الوظائف!

أركايف للذكاءمنذ 26 يوم
👁 2
كشف النقاب عن StartupBench: معيار جديد لوكالات الذكاء الاصطناعي في العمل الحقيقي!
أبحاث

كشف النقاب عن StartupBench: معيار جديد لوكالات الذكاء الاصطناعي في العمل الحقيقي!

أركايف للذكاءمنذ 26 يوم
👁 1
PACE-Bench: ثورة مراجعة أداء الذكاء الاصطناعي في البيئات الديناميكية!
أبحاث

PACE-Bench: ثورة مراجعة أداء الذكاء الاصطناعي في البيئات الديناميكية!

أركايف للذكاءمنذ 28 يوم
👁 4
فيثاغورث الذكاء الاصطناعي: هل تستطيع الوكلاء الذكائيون بناء مستودعات برمجية موسومة رسميًا؟
أبحاث

فيثاغورث الذكاء الاصطناعي: هل تستطيع الوكلاء الذكائيون بناء مستودعات برمجية موسومة رسميًا؟

أركايف للذكاءمنذ 1 شهر
👁 5
دليل MADBench: كيف نكشف خداع الصوت العميق بذكاء؟
أبحاث

دليل MADBench: كيف نكشف خداع الصوت العميق بذكاء؟

أركايف للذكاءمنذ 1 شهر
👁 2
ELBench: معيار متقدم لتقييم نماذج اللغة الذكية في التعليم
أبحاث

ELBench: معيار متقدم لتقييم نماذج اللغة الذكية في التعليم

أركايف للذكاءمنذ 1 شهر
👁 2
إنفرا كيو: معيار ثوري لمحاكاة الدوائر الكمية باستخدام قواعد البيانات!
أبحاث

إنفرا كيو: معيار ثوري لمحاكاة الدوائر الكمية باستخدام قواعد البيانات!

أركايف للذكاءمنذ 1 شهر
👁 2
إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!
أبحاث

إطلاق PatientAgentBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في الرعاية الصحية!

أركايف للذكاءمنذ 1 شهر
👁 2
هل يمكن للذكاء الاصطناعي تعلم السياق المتعدد الوسائط؟ اكتشفوا Benchmark CLBench-V المبتكر!
أبحاث

هل يمكن للذكاء الاصطناعي تعلم السياق المتعدد الوسائط؟ اكتشفوا Benchmark CLBench-V المبتكر!

أركايف للذكاءمنذ 1 شهر
👁 1
اكتشاف المعايير الجديدة: تقييم منصات البحث عن الأشخاص المدعومة بالذكاء الاصطناعي!
أبحاث

اكتشاف المعايير الجديدة: تقييم منصات البحث عن الأشخاص المدعومة بالذكاء الاصطناعي!

أركايف للذكاءمنذ 1 شهر
👁 1
اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!
أبحاث

اكتشاف FindStatBench: معيار جديد لتقييم نماذج اللغة في توليد الشيفرة!

أركايف للذكاءمنذ 1 شهر
👁 1
تقديم TReB: معيار شامل لتقييم قدرات التفكير في الجداول لنماذج اللغة الكبيرة!
أبحاث

تقديم TReB: معيار شامل لتقييم قدرات التفكير في الجداول لنماذج اللغة الكبيرة!

أركايف للذكاءمنذ 1 شهر
👁 1
CFM-Bench: مرجع موحد يغير قواعد المنافسة في نماذج القنوات المتعددة!
أبحاث

CFM-Bench: مرجع موحد يغير قواعد المنافسة في نماذج القنوات المتعددة!

أركايف للذكاءمنذ 1 شهر
👁 2
هل يمكننا الوثوق بنظرية استجابة العنصر لتقييم الذكاء الاصطناعي؟
أبحاث

هل يمكننا الوثوق بنظرية استجابة العنصر لتقييم الذكاء الاصطناعي؟

أركايف للذكاءمنذ 1 شهر
👁 4
1D-Bench: معيار ثوري لتوليد أكواد واجهات المستخدم بصورة تكرارية مع تغذية راجعة بصرية!
أبحاث

1D-Bench: معيار ثوري لتوليد أكواد واجهات المستخدم بصورة تكرارية مع تغذية راجعة بصرية!

أركايف للذكاءمنذ 2 شهر
إطلاق Shift & Drift: معيار جديد لتحدي تخطيط الحركة الذاتية بذكاء!
أبحاث

إطلاق Shift & Drift: معيار جديد لتحدي تخطيط الحركة الذاتية بذكاء!

أركايف للذكاءمنذ 2 شهر
👁 2