Ailoxa Logo

🏷️ #تقييم النماذج

83 مقال

CRAFT: الابتكار في تشخيص نقاط ضعف نماذج الذكاء الاصطناعي وتحسين أدائها
أبحاث

CRAFT: الابتكار في تشخيص نقاط ضعف نماذج الذكاء الاصطناعي وتحسين أدائها

أركايف للذكاءمنذ 1 شهر
👁 1
من المراقب إلى المتنبئ: تقييم مبتكر للطرائق الاستراتيجية المدعومة بالذكاء الاصطناعي
أبحاث

من المراقب إلى المتنبئ: تقييم مبتكر للطرائق الاستراتيجية المدعومة بالذكاء الاصطناعي

أركايف للذكاءمنذ 1 شهر
👁 1
هل يمكن لآرجوس الحكم عليهم جميعًا؟ استكشاف نماذج الرؤية واللغة بمختلف المجالات
أبحاث

هل يمكن لآرجوس الحكم عليهم جميعًا؟ استكشاف نماذج الرؤية واللغة بمختلف المجالات

أركايف للذكاءمنذ 1 شهر
👁 1
إعادة تعريف تقييم نماذج الذكاء الاصطناعي في الخدمات المالية: إطار عمليات مبتكر
أبحاث

إعادة تعريف تقييم نماذج الذكاء الاصطناعي في الخدمات المالية: إطار عمليات مبتكر

أركايف للذكاءمنذ 2 شهر
👁 1
HERO: إطار ثوري لتقييم نماذج الذكاء الاصطناعي يعزز الموثوقية والدقة!
أبحاث

HERO: إطار ثوري لتقييم نماذج الذكاء الاصطناعي يعزز الموثوقية والدقة!

أركايف للذكاءمنذ 2 شهر
👁 1
هل تميل benchmarks إلى تجاهل 82% من أداء نماذج الذكاء الاصطناعي؟ اكتشف الحقيقة وراء Capability Frontier!
أبحاث

هل تميل benchmarks إلى تجاهل 82% من أداء نماذج الذكاء الاصطناعي؟ اكتشف الحقيقة وراء Capability Frontier!

أركايف للذكاءمنذ 2 شهر
👁 1
ما الذي نفتقده في تقييم نماذج اللغة متعددة الوسائط؟
أبحاث

ما الذي نفتقده في تقييم نماذج اللغة متعددة الوسائط؟

أركايف للذكاءمنذ 2 شهر
👁 1
أدفيرسا بنش: نهج مبتكر لتقييم نماذج اللغة الكبيرة من خلال فريق مواجهة متعدد القضاة
أبحاث

أدفيرسا بنش: نهج مبتكر لتقييم نماذج اللغة الكبيرة من خلال فريق مواجهة متعدد القضاة

أركايف للذكاءمنذ 2 شهر
👁 3
هل يقيم نماذج اللغة الكبيرة (LLMs) أنفسهم بدافع النرجسية؟ دراسة تكشف تفاصيل مثيرة!
أبحاث

هل يقيم نماذج اللغة الكبيرة (LLMs) أنفسهم بدافع النرجسية؟ دراسة تكشف تفاصيل مثيرة!

أركايف للذكاءمنذ 2 شهر
ثورة في تقييم نماذج البرمجة: تعرف على Multi-LCB وتحديات البرمجة المتعددة!
نماذج لغوية

ثورة في تقييم نماذج البرمجة: تعرف على Multi-LCB وتحديات البرمجة المتعددة!

أركايف للذكاءمنذ 2 شهر
👁 2
JE-IRT: كيف تحدث نقلة نوعية في تقييم نماذج اللغات الضخمة باستخدام الهندسة الرياضية!
أبحاث

JE-IRT: كيف تحدث نقلة نوعية في تقييم نماذج اللغات الضخمة باستخدام الهندسة الرياضية!

أركايف للذكاءمنذ 2 شهر
حكم العملات: كيف تؤثر الثقة والانحياز في تقييم نماذج الذكاء الاصطناعي؟
أبحاث

حكم العملات: كيف تؤثر الثقة والانحياز في تقييم نماذج الذكاء الاصطناعي؟

أركايف للذكاءمنذ 2 شهر
👁 1
تحسينات العبارات العامة: متى تؤذي التطبيقات المعتمدة على نماذج اللغات الضخمة؟
أبحاث

تحسينات العبارات العامة: متى تؤذي التطبيقات المعتمدة على نماذج اللغات الضخمة؟

أركايف للذكاءمنذ 2 شهر
تعديل الموجهات الناعمة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!
نماذج لغوية

تعديل الموجهات الناعمة: الثورة الجديدة في تقييم نماذج اللغات الضخمة!

أركايف للذكاءمنذ 2 شهر
معايير تقييم نظم مراقبة السائقين: الابتكار بنظرة إنسانية!
أبحاث

معايير تقييم نظم مراقبة السائقين: الابتكار بنظرة إنسانية!

أركايف للذكاءمنذ 2 شهر
غلوك أويديو: مع معيار متعدد اللغات والثقافات لتقييم النماذج الصوتية اللغوية
أبحاث

غلوك أويديو: مع معيار متعدد اللغات والثقافات لتقييم النماذج الصوتية اللغوية

أركايف للذكاءمنذ 2 شهر
👁 1
تجاوز نسبة النجاح: تقييم شامل لنماذج البرمجة متعددة اللغات
نماذج لغوية

تجاوز نسبة النجاح: تقييم شامل لنماذج البرمجة متعددة اللغات

أركايف للذكاءمنذ 2 شهر
كيف يمكن أن تخدعنا وكالات البرمجة؟ الكشف عن الغش ومنعه باستخدام اختبارات عشوائية!
أبحاث

كيف يمكن أن تخدعنا وكالات البرمجة؟ الكشف عن الغش ومنعه باستخدام اختبارات عشوائية!

أركايف للذكاءمنذ 2 شهر
هجمات مضادة فعالة على خوارزميات Bandit في الأبعاد العالية: كيف يمكن للهجمات الذكية تغيير سلوك النماذج!
أبحاث

هجمات مضادة فعالة على خوارزميات Bandit في الأبعاد العالية: كيف يمكن للهجمات الذكية تغيير سلوك النماذج!

أركايف للذكاءمنذ 3 شهر
👁 1
اكتشاف AlgoVeri: معايير جديدة لتوليد الكود الموثوق في الخوارزميات الكلاسيكية
أبحاث

اكتشاف AlgoVeri: معايير جديدة لتوليد الكود الموثوق في الخوارزميات الكلاسيكية

أركايف للذكاءمنذ 3 شهر
👁 1