Ailoxa Logo

🏷️ #تقييم

379 مقال

LightEMMA: تقييم مبتكر لنماذج الرؤية-لغة في القيادة الذاتية
أبحاث

LightEMMA: تقييم مبتكر لنماذج الرؤية-لغة في القيادة الذاتية

أركايف للذكاءمنذ 1 يوم
👁 1
PatchBench: المعيار الثوري لتقييم وكلاء الذكاء الاصطناعي في تصحيح الثغرات
أبحاث

PatchBench: المعيار الثوري لتقييم وكلاء الذكاء الاصطناعي في تصحيح الثغرات

أركايف للذكاءمنذ 1 يوم
👁 1
إطلاق EvalDetectBench: المعيار الثوري لرصد الوعي بالتقييم في نماذج اللغة المتقدمة!
أبحاث

إطلاق EvalDetectBench: المعيار الثوري لرصد الوعي بالتقييم في نماذج اللغة المتقدمة!

أركايف للذكاءمنذ 2 يوم
تقييم المُقيّم: كيف تُحدث المقاييس الصادرة عن نماذج الذكاء الاصطناعي ثورة في تلخيص النصوص؟
أبحاث

تقييم المُقيّم: كيف تُحدث المقاييس الصادرة عن نماذج الذكاء الاصطناعي ثورة في تلخيص النصوص؟

أركايف للذكاءمنذ 2 يوم
👁 1
أداة ثورية لتقييم نماذج الذكاء الاصطناعي عبر جميع الوسائط: OmniEvaluator
أدوات

أداة ثورية لتقييم نماذج الذكاء الاصطناعي عبر جميع الوسائط: OmniEvaluator

أركايف للذكاءمنذ 3 يوم
👁 1
استكشاف حدود الحماية: كيف ترسم الفشل في تقييمات الذكاء الاصطناعي – مُدخلات مثيرة!
أبحاث

استكشاف حدود الحماية: كيف ترسم الفشل في تقييمات الذكاء الاصطناعي – مُدخلات مثيرة!

أركايف للذكاءمنذ 3 يوم
تطور مذهل في تقييم الوكلاء الحواريين: تعرف على SAGE!
أبحاث

تطور مذهل في تقييم الوكلاء الحواريين: تعرف على SAGE!

أركايف للذكاءمنذ 3 يوم
👁 1
ثورة جديدة في تقييم الأمن: كيفية مقاومة jailbreak لنماذج اللغات الضخمة
أبحاث

ثورة جديدة في تقييم الأمن: كيفية مقاومة jailbreak لنماذج اللغات الضخمة

أركايف للذكاءمنذ 3 يوم
👁 1
دراما تشين بنش: معايير شاملة لتوليد الدراما القصيرة
أبحاث

دراما تشين بنش: معايير شاملة لتوليد الدراما القصيرة

أركايف للذكاءمنذ 3 يوم
👁 1
اكتشاف المكونات الحاسوبية لتمثيلات تشبه البشر في نماذج اللغات الضخمة
نماذج لغوية

اكتشاف المكونات الحاسوبية لتمثيلات تشبه البشر في نماذج اللغات الضخمة

أركايف للذكاءمنذ 3 يوم
أنتروبك تطلق كلود فابل 5.1 وكلود ميثوس 5.1: الأداء المذهل بتخفيضات هائلة!

أنتروبك تطلق كلود فابل 5.1 وكلود ميثوس 5.1: الأداء المذهل بتخفيضات هائلة!

مارك تيك بوستمنذ 3 يوم
👁 3
هل يمكن لوكلاء LLM اكتشاف حلول مبتكرة؟ تقييم الإبداع في مهام الهندسة باستخدام الذكاء الاصطناعي
أبحاث

هل يمكن لوكلاء LLM اكتشاف حلول مبتكرة؟ تقييم الإبداع في مهام الهندسة باستخدام الذكاء الاصطناعي

أركايف للذكاءمنذ 4 يوم
👁 1
ما هي رخصة التقييم؟ استكشاف بحثي لأهمية توثيق النتائج في اختبارات الأداء
أبحاث

ما هي رخصة التقييم؟ استكشاف بحثي لأهمية توثيق النتائج في اختبارات الأداء

أركايف للذكاءمنذ 4 يوم
👁 1
منهجية مبتكرة لتقييم الأبحاث: كيف يعزز AutoSciRub أداء الوكلاء البحثيين
أبحاث

منهجية مبتكرة لتقييم الأبحاث: كيف يعزز AutoSciRub أداء الوكلاء البحثيين

أركايف للذكاءمنذ 4 يوم
👁 1
ATLAS: الإطار الثوري لتقييم أدوات الذكاء الاصطناعي في الصناعة
أبحاث

ATLAS: الإطار الثوري لتقييم أدوات الذكاء الاصطناعي في الصناعة

أركايف للذكاءمنذ 4 يوم
👁 2
تحديات معالجة النصوص: تقييم نماذج اللغة الكبيرة في تحويل النصوص الحوارية إلى SQL!
أبحاث

تحديات معالجة النصوص: تقييم نماذج اللغة الكبيرة في تحويل النصوص الحوارية إلى SQL!

أركايف للذكاءمنذ 4 يوم
ساحة التفكير: تقييم أفكار البحث التي تولدها نماذج اللغات الكبيرة بأسلوب المعارك
أبحاث

ساحة التفكير: تقييم أفكار البحث التي تولدها نماذج اللغات الكبيرة بأسلوب المعارك

أركايف للذكاءمنذ 4 يوم
👁 1
المؤشر النضجي للأنماط: معيار جديد لتقييم قدرات النماذج المتعددة الوسائط
أبحاث

المؤشر النضجي للأنماط: معيار جديد لتقييم قدرات النماذج المتعددة الوسائط

أركايف للذكاءمنذ 8 يوم
👁 2
PACEShop: ثورة جديدة في تقييم مساعدي التسوق الشخصيين!
أدوات

PACEShop: ثورة جديدة في تقييم مساعدي التسوق الشخصيين!

أركايف للذكاءمنذ 8 يوم
👁 2
آفاق جديدة: تدقيق الدقة التجريبية في الأبحاث العلمية المدعومة بنماذج اللغات الضخمة
أبحاث

آفاق جديدة: تدقيق الدقة التجريبية في الأبحاث العلمية المدعومة بنماذج اللغات الضخمة

أركايف للذكاءمنذ 8 يوم
👁 1