Ailoxa Logo

🏷️ #تقييم النماذج

63 مقال

CRAFT: الابتكار في تشخيص نقاط ضعف نماذج الذكاء الاصطناعي وتحسين أدائها
أبحاث

CRAFT: الابتكار في تشخيص نقاط ضعف نماذج الذكاء الاصطناعي وتحسين أدائها

أركايف للذكاءمنذ 8 ساعة
👁 1
هل يمكن لآرجوس الحكم عليهم جميعًا؟ استكشاف نماذج الرؤية واللغة بمختلف المجالات
أبحاث

هل يمكن لآرجوس الحكم عليهم جميعًا؟ استكشاف نماذج الرؤية واللغة بمختلف المجالات

أركايف للذكاءمنذ 6 يوم
من المراقب إلى المتنبئ: تقييم مبتكر للطرائق الاستراتيجية المدعومة بالذكاء الاصطناعي
أبحاث

من المراقب إلى المتنبئ: تقييم مبتكر للطرائق الاستراتيجية المدعومة بالذكاء الاصطناعي

أركايف للذكاءمنذ 6 يوم
إعادة تعريف تقييم نماذج الذكاء الاصطناعي في الخدمات المالية: إطار عمليات مبتكر
أبحاث

إعادة تعريف تقييم نماذج الذكاء الاصطناعي في الخدمات المالية: إطار عمليات مبتكر

أركايف للذكاءمنذ 17 يوم
👁 1
HERO: إطار ثوري لتقييم نماذج الذكاء الاصطناعي يعزز الموثوقية والدقة!
أبحاث

HERO: إطار ثوري لتقييم نماذج الذكاء الاصطناعي يعزز الموثوقية والدقة!

أركايف للذكاءمنذ 20 يوم
👁 1
هل تميل benchmarks إلى تجاهل 82% من أداء نماذج الذكاء الاصطناعي؟ اكتشف الحقيقة وراء Capability Frontier!
أبحاث

هل تميل benchmarks إلى تجاهل 82% من أداء نماذج الذكاء الاصطناعي؟ اكتشف الحقيقة وراء Capability Frontier!

أركايف للذكاءمنذ 24 يوم
👁 1
ما الذي نفتقده في تقييم نماذج اللغة متعددة الوسائط؟
أبحاث

ما الذي نفتقده في تقييم نماذج اللغة متعددة الوسائط؟

أركايف للذكاءمنذ 24 يوم
👁 1
أدفيرسا بنش: نهج مبتكر لتقييم نماذج اللغة الكبيرة من خلال فريق مواجهة متعدد القضاة
أبحاث

أدفيرسا بنش: نهج مبتكر لتقييم نماذج اللغة الكبيرة من خلال فريق مواجهة متعدد القضاة

أركايف للذكاءمنذ 26 يوم
👁 1
هل يقيم نماذج اللغة الكبيرة (LLMs) أنفسهم بدافع النرجسية؟ دراسة تكشف تفاصيل مثيرة!
أبحاث

هل يقيم نماذج اللغة الكبيرة (LLMs) أنفسهم بدافع النرجسية؟ دراسة تكشف تفاصيل مثيرة!

أركايف للذكاءمنذ 26 يوم
ثورة في تقييم نماذج البرمجة: تعرف على Multi-LCB وتحديات البرمجة المتعددة!
نماذج لغوية

ثورة في تقييم نماذج البرمجة: تعرف على Multi-LCB وتحديات البرمجة المتعددة!

أركايف للذكاءمنذ 1 شهر
👁 2
JE-IRT: كيف تحدث نقلة نوعية في تقييم نماذج اللغات الضخمة باستخدام الهندسة الرياضية!
أبحاث

JE-IRT: كيف تحدث نقلة نوعية في تقييم نماذج اللغات الضخمة باستخدام الهندسة الرياضية!

أركايف للذكاءمنذ 1 شهر
حكم العملات: كيف تؤثر الثقة والانحياز في تقييم نماذج الذكاء الاصطناعي؟
أبحاث

حكم العملات: كيف تؤثر الثقة والانحياز في تقييم نماذج الذكاء الاصطناعي؟

أركايف للذكاءمنذ 1 شهر
تحسينات العبارات العامة: متى تؤذي التطبيقات المعتمدة على نماذج اللغات الضخمة؟
أبحاث

تحسينات العبارات العامة: متى تؤذي التطبيقات المعتمدة على نماذج اللغات الضخمة؟

أركايف للذكاءمنذ 1 شهر
تعديل الموجهات الناعمة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!
نماذج لغوية

تعديل الموجهات الناعمة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!

أركايف للذكاءمنذ 1 شهر
تجاوز نسبة النجاح: تقييم شامل لنماذج البرمجة متعددة اللغات
نماذج لغوية

تجاوز نسبة النجاح: تقييم شامل لنماذج البرمجة متعددة اللغات

أركايف للذكاءمنذ 1 شهر
غلوك أويديو: مع معيار متعدد اللغات والثقافات لتقييم النماذج الصوتية اللغوية
أبحاث

غلوك أويديو: مع معيار متعدد اللغات والثقافات لتقييم النماذج الصوتية اللغوية

أركايف للذكاءمنذ 1 شهر
معايير تقييم نظم مراقبة السائقين: الابتكار بنظرة إنسانية!
أبحاث

معايير تقييم نظم مراقبة السائقين: الابتكار بنظرة إنسانية!

أركايف للذكاءمنذ 1 شهر
كيف يمكن أن تخدعنا وكالات البرمجة؟ الكشف عن الغش ومنعه باستخدام اختبارات عشوائية!
أبحاث

كيف يمكن أن تخدعنا وكالات البرمجة؟ الكشف عن الغش ومنعه باستخدام اختبارات عشوائية!

أركايف للذكاءمنذ 1 شهر
اكتشاف AlgoVeri: معايير جديدة لتوليد الكود الموثوق في الخوارزميات الكلاسيكية
أبحاث

اكتشاف AlgoVeri: معايير جديدة لتوليد الكود الموثوق في الخوارزميات الكلاسيكية

أركايف للذكاءمنذ 1 شهر
👁 1
هجمات مضادة فعالة على خوارزميات Bandit في الأبعاد العالية: كيف يمكن للهجمات الذكية تغيير سلوك النماذج!
أبحاث

هجمات مضادة فعالة على خوارزميات Bandit في الأبعاد العالية: كيف يمكن للهجمات الذكية تغيير سلوك النماذج!

أركايف للذكاءمنذ 1 شهر
👁 1