Ailoxa Logo

🏷️ #تقييم

273 مقال

نموذج نظرية الاستجابة الزمنية: تقييم نماذج اللغات الضخمة بدقة الاستجابة وطول سلسلة الأفكار
نماذج لغوية

نموذج نظرية الاستجابة الزمنية: تقييم نماذج اللغات الضخمة بدقة الاستجابة وطول سلسلة الأفكار

أركايف للذكاءمنذ 12 ساعة
IMBench: معايير مبتكرة لتحقيق التلاعب البديهي في الروبوتات
روبوتات

IMBench: معايير مبتكرة لتحقيق التلاعب البديهي في الروبوتات

أركايف للذكاءمنذ 12 ساعة
تحقيق الأداء المثالي: كيف تعيد تقنيات Copy-on-Write تقييم وكالات الذكاء الاصطناعي؟
أبحاث

تحقيق الأداء المثالي: كيف تعيد تقنيات Copy-on-Write تقييم وكالات الذكاء الاصطناعي؟

أركايف للذكاءمنذ 3 يوم
👁 1
اكتشفوا OmniaBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في سيناريوهات متنوعة!
نماذج لغوية

اكتشفوا OmniaBench: معيار ثوري لتقييم وكلاء الذكاء الاصطناعي في سيناريوهات متنوعة!

أركايف للذكاءمنذ 3 يوم
تجاوز هندسة الألوان: تقييم تمثيلات الألوان البشرية في نماذج الرؤية
أبحاث

تجاوز هندسة الألوان: تقييم تمثيلات الألوان البشرية في نماذج الرؤية

أركايف للذكاءمنذ 4 يوم
مؤشر حساسية التنسيق: كيف يؤثر اختيار التطبيقات على نتائج نماذج الذكاء الاصطناعي؟
أبحاث

مؤشر حساسية التنسيق: كيف يؤثر اختيار التطبيقات على نتائج نماذج الذكاء الاصطناعي؟

أركايف للذكاءمنذ 6 يوم
👁 1
CRiT-QA: ثورة في تقييم التفكير المتعدد الخطوات لمواجهة الفخاخ المُضللة!
أبحاث

CRiT-QA: ثورة في تقييم التفكير المتعدد الخطوات لمواجهة الفخاخ المُضللة!

أركايف للذكاءمنذ 6 يوم
Imaging-101: ثورة في التقييم وتحسين مهارات النماذج اللغوية في التصوير الحاسوبي!
أبحاث

Imaging-101: ثورة في التقييم وتحسين مهارات النماذج اللغوية في التصوير الحاسوبي!

أركايف للذكاءمنذ 6 يوم
👁 1
من الزخم إلى الاستقرار: كيف يُقاس ظهور الذكاء الاصطناعي بطريقة موثوقة؟
أبحاث

من الزخم إلى الاستقرار: كيف يُقاس ظهور الذكاء الاصطناعي بطريقة موثوقة؟

أركايف للذكاءمنذ 6 يوم
👁 1
فخ الامتثال: كيفية استهلاك وكالات الذكاء الاصطناعي لذاكرة متناقضة
أبحاث

فخ الامتثال: كيفية استهلاك وكالات الذكاء الاصطناعي لذاكرة متناقضة

أركايف للذكاءمنذ 6 يوم
ثورة الذكاء الاصطناعي: كيف يؤثر تغيير القاضي على دقة نموذج الحكم؟
أبحاث

ثورة الذكاء الاصطناعي: كيف يؤثر تغيير القاضي على دقة نموذج الحكم؟

أركايف للذكاءمنذ 10 يوم
👁 1
TOPO-Bench: ثورة في تقييم الخرائط الطوبولوجية مع مقاييس قابلة للقياس
أبحاث

TOPO-Bench: ثورة في تقييم الخرائط الطوبولوجية مع مقاييس قابلة للقياس

أركايف للذكاءمنذ 10 يوم
👁 1
اكتشاف النقاط العمياء: تحدي جديد في نماذج الذكاء الاصطناعي متعددة الوسائط
أبحاث

اكتشاف النقاط العمياء: تحدي جديد في نماذج الذكاء الاصطناعي متعددة الوسائط

أركايف للذكاءمنذ 10 يوم
👁 1
تقييم شامل لمخرجات نماذج اللغات الضخمة: نظام تصنيف متعدد العوامل
أبحاث

تقييم شامل لمخرجات نماذج اللغات الضخمة: نظام تصنيف متعدد العوامل

أركايف للذكاءمنذ 11 يوم
ثورة في تقييم أمان الذكاء الاصطناعي: مقياس جديد لقياس شدة الأفعال!
أبحاث

ثورة في تقييم أمان الذكاء الاصطناعي: مقياس جديد لقياس شدة الأفعال!

أركايف للذكاءمنذ 11 يوم
عدم استقرار الانحياز الأخلاقي في نماذج اللغات: كيف يؤثر الإطار على القرارات الأخلاقية؟
أخلاقيات الذكاء الاصطناعي

عدم استقرار الانحياز الأخلاقي في نماذج اللغات: كيف يؤثر الإطار على القرارات الأخلاقية؟

أركايف للذكاءمنذ 11 يوم
👁 1
هل نستعد لعصر جديد من الذكاء الاصطناعي؟ استكشاف التحسين الذاتي المتكرر!
أبحاث

هل نستعد لعصر جديد من الذكاء الاصطناعي؟ استكشاف التحسين الذاتي المتكرر!

أركايف للذكاءمنذ 11 يوم
👁 1
ثورة جديدة في الذكاء الاصطناعي: أداة RuBench للتقييم الذكي بلغة روسية!
أبحاث

ثورة جديدة في الذكاء الاصطناعي: أداة RuBench للتقييم الذكي بلغة روسية!

أركايف للذكاءمنذ 12 يوم
👁 1
هل يمكن للذكاء الاصطناعي أن يقدم إجابات موثوقة؟ دراسة تكشف العلاقة بين نوع السؤال وموثوقية النماذج اللغوية!
أبحاث

هل يمكن للذكاء الاصطناعي أن يقدم إجابات موثوقة؟ دراسة تكشف العلاقة بين نوع السؤال وموثوقية النماذج اللغوية!

أركايف للذكاءمنذ 12 يوم
إطار تقييم جديد للذكاء الاصطناعي: كيف يمكن لنماذج اللغات الضخمة إنتاج مصفوفات بنية التصميم؟
أبحاث

إطار تقييم جديد للذكاء الاصطناعي: كيف يمكن لنماذج اللغات الضخمة إنتاج مصفوفات بنية التصميم؟

أركايف للذكاءمنذ 12 يوم
👁 1