Ailoxa Logo

🏷️ #تقييم الأداء

165 مقال

هل تختار حجماً مناسباً لنموذجك اللغوي؟ اكتشف كيف تؤثر الخيارات على الاستدامة والكفاءة!
نماذج لغوية

هل تختار حجماً مناسباً لنموذجك اللغوي؟ اكتشف كيف تؤثر الخيارات على الاستدامة والكفاءة!

أركايف للذكاءمنذ 2 شهر
👁 1
DBES: نظام مبتكر لتقييم التخصصات الخبيرة في نماذج Mixture-of-Experts
أبحاث

DBES: نظام مبتكر لتقييم التخصصات الخبيرة في نماذج Mixture-of-Experts

أركايف للذكاءمنذ 2 شهر
SCICONVBENCH: معيار ثوري لتحسين نماذج الذكاء الاصطناعي في العلوم الحاسوبية!
أبحاث

SCICONVBENCH: معيار ثوري لتحسين نماذج الذكاء الاصطناعي في العلوم الحاسوبية!

أركايف للذكاءمنذ 2 شهر
هل من الممكن أن تحقق النتائج النجاح بينما تفشل الانضباط؟ اكتشفوا كيف تؤثر التقييمات المستندة إلى الشروط الخفية!
أبحاث

هل من الممكن أن تحقق النتائج النجاح بينما تفشل الانضباط؟ اكتشفوا كيف تؤثر التقييمات المستندة إلى الشروط الخفية!

أركايف للذكاءمنذ 2 شهر
تقييم توافق العمر المعرفي في وكلاء الذكاء الاصطناعي التفاعلي: خطوة نحو الذكاء البشري!
أبحاث

تقييم توافق العمر المعرفي في وكلاء الذكاء الاصطناعي التفاعلي: خطوة نحو الذكاء البشري!

أركايف للذكاءمنذ 2 شهر
WebGameBench: ثورة في تقييم وكالات البرمجة عبر ألعاب الويب
أبحاث

WebGameBench: ثورة في تقييم وكالات البرمجة عبر ألعاب الويب

أركايف للذكاءمنذ 2 شهر
فورمولا كود: ثورة في تحسين الشيفرة المصدرية باستخدام الذكاء الاصطناعي!
أبحاث

فورمولا كود: ثورة في تحسين الشيفرة المصدرية باستخدام الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
كيف يمكن لمعايير تقييم نية الذكاء الاصطناعي أن تغير قواعد اللعبة في تطوير نماذج اللغة الكبيرة؟
أبحاث

كيف يمكن لمعايير تقييم نية الذكاء الاصطناعي أن تغير قواعد اللعبة في تطوير نماذج اللغة الكبيرة؟

أركايف للذكاءمنذ 2 شهر
ATBench: منصة جديدة لقياس سلامة وكفاءة الوكلاء الذكيين!
أبحاث

ATBench: منصة جديدة لقياس سلامة وكفاءة الوكلاء الذكيين!

أركايف للذكاءمنذ 2 شهر
EVA-Bench: الإطار الثوري لتقييم الوكلاء الصوتيين في الذكاء الاصطناعي!
أبحاث

EVA-Bench: الإطار الثوري لتقييم الوكلاء الصوتيين في الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
قياس ما يهم: معايير جديدة للذكاء الاصطناعي في الرعاية الصحية
أبحاث

قياس ما يهم: معايير جديدة للذكاء الاصطناعي في الرعاية الصحية

أركايف للذكاءمنذ 2 شهر
DSGBench: منصة رائدة لتقييم الوكلاء المعتمدين على نماذج اللغة الكبيرة في بيئات صنع القرار المعقدة!
أبحاث

DSGBench: منصة رائدة لتقييم الوكلاء المعتمدين على نماذج اللغة الكبيرة في بيئات صنع القرار المعقدة!

أركايف للذكاءمنذ 2 شهر
تحليل فريد لتقييم دقة الإشارة المرجعية باستخدام سُمّيات صريحة
أبحاث

تحليل فريد لتقييم دقة الإشارة المرجعية باستخدام سُمّيات صريحة

أركايف للذكاءمنذ 2 شهر
تطوير معايير تقييم فعّالة خالية من تسرب المعرفة لتعزيز قوة نماذج الذكاء الاصطناعي
أبحاث

تطوير معايير تقييم فعّالة خالية من تسرب المعرفة لتعزيز قوة نماذج الذكاء الاصطناعي

أركايف للذكاءمنذ 2 شهر
الانتقال من التحكم إلى البرية: تقييم وكالات اختبار الاختراق في العالم الحقيقي!
أبحاث

الانتقال من التحكم إلى البرية: تقييم وكالات اختبار الاختراق في العالم الحقيقي!

أركايف للذكاءمنذ 2 شهر
👁 1
إنشاء EnactToM: معيار متطور لفهم نظرية العقل في الوكلاء الجسديين
أبحاث

إنشاء EnactToM: معيار متطور لفهم نظرية العقل في الوكلاء الجسديين

أركايف للذكاءمنذ 2 شهر
ثورة جديدة في ضغط السياق: أساسيات قوية لتحسين الأداء في الذكاء الاصطناعي!
أبحاث

ثورة جديدة في ضغط السياق: أساسيات قوية لتحسين الأداء في الذكاء الاصطناعي!

أركايف للذكاءمنذ 2 شهر
👁 1
الحلول الدقيقة: الثقة في تقييمات وكلاء LLM التعاونية
أبحاث

الحلول الدقيقة: الثقة في تقييمات وكلاء LLM التعاونية

أركايف للذكاءمنذ 2 شهر
👁 1
اختبار حساسية النصوص: كيف تتفاعل نماذج الذكاء الاصطناعي مع لغات العالم المتعددة؟
أبحاث

اختبار حساسية النصوص: كيف تتفاعل نماذج الذكاء الاصطناعي مع لغات العالم المتعددة؟

أركايف للذكاءمنذ 2 شهر
👁 1
SCOPE: تطور ثوري في توليد الصور المعقدة بفضل تنظيم المهارات المشروط
أبحاث

SCOPE: تطور ثوري في توليد الصور المعقدة بفضل تنظيم المهارات المشروط

أركايف للذكاءمنذ 2 شهر