Ailoxa Logo

🏷️ #تقييم

379 مقال

فليفر بنش: تصنيف نماذج اللغات الرائدة باستخدام حقائق طهو قابلة للتنفيذ
نماذج لغوية

فليفر بنش: تصنيف نماذج اللغات الرائدة باستخدام حقائق طهو قابلة للتنفيذ

أركايف للذكاءمنذ 12 يوم
👁 1
اكتشاف حدود الذكاء الاصطناعي في تقديم استشارات قانونية: InsufficiencyBench ينطلق!
أبحاث

اكتشاف حدود الذكاء الاصطناعي في تقديم استشارات قانونية: InsufficiencyBench ينطلق!

أركايف للذكاءمنذ 15 يوم
👁 1
هل تعزز تفضيلات الذكاء الاصطناعي الدوافع الثنائية في التقييمات؟
أبحاث

هل تعزز تفضيلات الذكاء الاصطناعي الدوافع الثنائية في التقييمات؟

أركايف للذكاءمنذ 16 يوم
👁 1
ثورة في تحرير الموسيقى: إطار تقييم جديد يحافظ على سياقات الموسيقى!
أبحاث

ثورة في تحرير الموسيقى: إطار تقييم جديد يحافظ على سياقات الموسيقى!

أركايف للذكاءمنذ 16 يوم
👁 1
خطوة ثورية في الذكاء الاصطناعي الطبي: MedUAG يحقق قفزة نوعية في الفهم والتوليد
أبحاث

خطوة ثورية في الذكاء الاصطناعي الطبي: MedUAG يحقق قفزة نوعية في الفهم والتوليد

أركايف للذكاءمنذ 16 يوم
👁 1
SESSE: الابتكار الثوري في تقييم نماذج الذكاء الاصطناعي من خلال منهجيات هيكلية!
أبحاث

SESSE: الابتكار الثوري في تقييم نماذج الذكاء الاصطناعي من خلال منهجيات هيكلية!

أركايف للذكاءمنذ 16 يوم
👁 1
هل يفضل الذكاء الاصطناعي الأسماء اللامعة؟ دراسة تكشف التحيز الجغرافي في نماذج اللغة الكبيرة!
أبحاث

هل يفضل الذكاء الاصطناعي الأسماء اللامعة؟ دراسة تكشف التحيز الجغرافي في نماذج اللغة الكبيرة!

أركايف للذكاءمنذ 16 يوم
👁 4
تحول جذري في تقييم خصائص الذكاء الاصطناعي: تعرف على مؤشر المشاعر الأساسية (CSI)
أبحاث

تحول جذري في تقييم خصائص الذكاء الاصطناعي: تعرف على مؤشر المشاعر الأساسية (CSI)

أركايف للذكاءمنذ 17 يوم
تحسين تقييمات الامتحانات: لماذا تحتاج إلى معايير دقيقة بدلاً من الذكاء فقط؟
أبحاث

تحسين تقييمات الامتحانات: لماذا تحتاج إلى معايير دقيقة بدلاً من الذكاء فقط؟

أركايف للذكاءمنذ 17 يوم
👁 1
تقييم جديد لهجمات اختراق النماذج اللغوية الضخمة: الكشف عن نجاحات غير عادلة!
أبحاث

تقييم جديد لهجمات اختراق النماذج اللغوية الضخمة: الكشف عن نجاحات غير عادلة!

أركايف للذكاءمنذ 17 يوم
👁 2
أين تفتقر نماذج الذكاء الاصطناعي في تقييم الأخلاق؟ تحليل جديد يكشف النقاب!
أبحاث

أين تفتقر نماذج الذكاء الاصطناعي في تقييم الأخلاق؟ تحليل جديد يكشف النقاب!

أركايف للذكاءمنذ 18 يوم
👁 1
ALPS: ثورة في قياس الإبداع الحقيقي بنماذج اللغة الكبيرة!
نماذج لغوية

ALPS: ثورة في قياس الإبداع الحقيقي بنماذج اللغة الكبيرة!

أركايف للذكاءمنذ 18 يوم
👁 2
CaliBench: كيف تُعيد ديناميكيات الفيديو ضبط النماذج عالمياً بدقة فيزيائية؟
أبحاث

CaliBench: كيف تُعيد ديناميكيات الفيديو ضبط النماذج عالمياً بدقة فيزيائية؟

أركايف للذكاءمنذ 18 يوم
👁 1
دراسة حديثة: هل تقيس أدوات التقييم نفس الشيء للإنسان ونماذج اللغات الضخمة؟
أبحاث

دراسة حديثة: هل تقيس أدوات التقييم نفس الشيء للإنسان ونماذج اللغات الضخمة؟

أركايف للذكاءمنذ 18 يوم
👁 2
كيفية التوقف في الوقت المناسب: إطار توقف مثالي بايزي لتقييم النماذج اللغوية
أبحاث

كيفية التوقف في الوقت المناسب: إطار توقف مثالي بايزي لتقييم النماذج اللغوية

أركايف للذكاءمنذ 19 يوم
👁 1
CangjieBench: نقلة نوعية في تقييم نماذج اللغة الضخمة للغات البرمجة منخفضة الموارد!
أبحاث

CangjieBench: نقلة نوعية في تقييم نماذج اللغة الضخمة للغات البرمجة منخفضة الموارد!

أركايف للذكاءمنذ 22 يوم
👁 1
إطلاق معيار موحد متعدد الأبعاد لتقييم الاستدلال المعقد في نماذج اللغات الضخمة!
نماذج لغوية

إطلاق معيار موحد متعدد الأبعاد لتقييم الاستدلال المعقد في نماذج اللغات الضخمة!

أركايف للذكاءمنذ 22 يوم
👁 1
إطلاق LigBench: معيار مبتكر لتوليد أفكار البحث المعتمدة على نماذج اللغة الضخمة!
أبحاث

إطلاق LigBench: معيار مبتكر لتوليد أفكار البحث المعتمدة على نماذج اللغة الضخمة!

أركايف للذكاءمنذ 22 يوم
👁 2
قوة لجنة التحكيم: نظام جديد لتحسين تقييم أداء نماذج التفكير القائم على الذكاء الاصطناعي
أبحاث

قوة لجنة التحكيم: نظام جديد لتحسين تقييم أداء نماذج التفكير القائم على الذكاء الاصطناعي

أركايف للذكاءمنذ 22 يوم
👁 1
تسليط الضوء على تسريبات العلاج في تقييم أمان الوكلاء باستخدام أدوات الذكاء الاصطناعي
أبحاث

تسليط الضوء على تسريبات العلاج في تقييم أمان الوكلاء باستخدام أدوات الذكاء الاصطناعي

أركايف للذكاءمنذ 22 يوم
👁 1