Ailoxa Logo

🏷️ #تقييم النماذج

83 مقال

FLY-EVAL++: بروتوكول ثوري لتقييم سلامة نماذج اللغة في الطيران!
أبحاث

FLY-EVAL++: بروتوكول ثوري لتقييم سلامة نماذج اللغة في الطيران!

أركايف للذكاءمنذ 17 ساعة
كيف يمكن لنماذج اللغات الضخمة أن تعيد تشكيل الوعي الثقافي؟
أبحاث

كيف يمكن لنماذج اللغات الضخمة أن تعيد تشكيل الوعي الثقافي؟

أركايف للذكاءمنذ 1 يوم
استقلالية النماذج اللغوية: ما بين التناسق والصدفة
أبحاث

استقلالية النماذج اللغوية: ما بين التناسق والصدفة

أركايف للذكاءمنذ 2 يوم
👁 1
إعادة تشكيل تقييمات النماذج اللغوية: توازن المعايير وأهمية الكثافة الدلالية
أبحاث

إعادة تشكيل تقييمات النماذج اللغوية: توازن المعايير وأهمية الكثافة الدلالية

أركايف للذكاءمنذ 3 يوم
👁 1
تقييم الذكاء الاصطناعي: كيف يقيم النماذج اللغوية كفاءة اللهجة والثقافة السعودية؟
نماذج لغوية

تقييم الذكاء الاصطناعي: كيف يقيم النماذج اللغوية كفاءة اللهجة والثقافة السعودية؟

أركايف للذكاءمنذ 3 يوم
👁 1
إعادة تعريف التقييم: نظام Imag-Eval لتقييم أداء نماذج تحويل النص إلى صورة!
أبحاث

إعادة تعريف التقييم: نظام Imag-Eval لتقييم أداء نماذج تحويل النص إلى صورة!

أركايف للذكاءمنذ 3 يوم
👁 1
تنفيذ تقييم متجدد لنماذج الذكاء الاصطناعي في الطب الحيوي: كيف تتفوق Llama-3.1-8B-Instruct؟
أبحاث

تنفيذ تقييم متجدد لنماذج الذكاء الاصطناعي في الطب الحيوي: كيف تتفوق Llama-3.1-8B-Instruct؟

أركايف للذكاءمنذ 3 يوم
👁 1
CorporateBench: معايير جديدة لتقييم الذكاء الاصطناعي في استفسارات الشركات
أدوات

CorporateBench: معايير جديدة لتقييم الذكاء الاصطناعي في استفسارات الشركات

أركايف للذكاءمنذ 7 يوم
👁 1
من التصور السببي إلى الاعتماد السببي: تقييم نماذج اللغة الكبيرة كمدربين على تصنيفات causal-edge!
أبحاث

من التصور السببي إلى الاعتماد السببي: تقييم نماذج اللغة الكبيرة كمدربين على تصنيفات causal-edge!

أركايف للذكاءمنذ 9 يوم
ليكويد AI تطلق منصة بيبت لتقييم أداء نماذج الذكاء الاصطناعي على الأجهزة المحمولة!
أدوات

ليكويد AI تطلق منصة بيبت لتقييم أداء نماذج الذكاء الاصطناعي على الأجهزة المحمولة!

مارك تيك بوستمنذ 9 يوم
👁 1
هل يمكن للذكاء الاصطناعي أن يدعم الأدلة العلمية في معادلات PDE؟
أبحاث

هل يمكن للذكاء الاصطناعي أن يدعم الأدلة العلمية في معادلات PDE؟

أركايف للذكاءمنذ 10 يوم
👁 1
إطلاق EgoMonth: معيار الفيديوهات الشخصية لتحسين الذاكرة الزمكانية طويلة الأمد!
أبحاث

إطلاق EgoMonth: معيار الفيديوهات الشخصية لتحسين الذاكرة الزمكانية طويلة الأمد!

أركايف للذكاءمنذ 21 يوم
👁 1
C$^3$PO: ثورة جديدة في تقييم النماذج الذكية من خلال دمج الحواس!
أبحاث

C$^3$PO: ثورة جديدة في تقييم النماذج الذكية من خلال دمج الحواس!

أركايف للذكاءمنذ 28 يوم
إعادة تعريف العقلانية: تقييم بدون تسميات وأنظمة تنظيم مبتكرة في الذكاء الاصطناعي
أبحاث

إعادة تعريف العقلانية: تقييم بدون تسميات وأنظمة تنظيم مبتكرة في الذكاء الاصطناعي

أركايف للذكاءمنذ 29 يوم
👁 1
ثورة في تقييم نماذج الذكاء الاصطناعي: اكتشافات SciCode تُحدث نقلة نوعية في قدرة البرمجة العلمية!
نماذج لغوية

ثورة في تقييم نماذج الذكاء الاصطناعي: اكتشافات SciCode تُحدث نقلة نوعية في قدرة البرمجة العلمية!

أركايف للذكاءمنذ 29 يوم
👁 3
تعزيز الذكاء الاصطناعي من خلال قياس توافق راشومون: ثورة في تقييم النماذج
أبحاث

تعزيز الذكاء الاصطناعي من خلال قياس توافق راشومون: ثورة في تقييم النماذج

أركايف للذكاءمنذ 1 شهر
👁 1
هل تدفع تكلفة المعرفة ثمنًا أكبر؟ بروتوكول جديد لتقييم صحة النماذج المعتمدة على الموارد
أبحاث

هل تدفع تكلفة المعرفة ثمنًا أكبر؟ بروتوكول جديد لتقييم صحة النماذج المعتمدة على الموارد

أركايف للذكاءمنذ 1 شهر
👁 1
اختيار نموذج تضمين النصوص: دليل عملي لتقييم الخيارات واتخاذ القرار
أبحاث

اختيار نموذج تضمين النصوص: دليل عملي لتقييم الخيارات واتخاذ القرار

أركايف للذكاءمنذ 1 شهر
👁 1
اكتشاف مبكر لعدم توافق استنتاجات نماذج التسلسل: كيف تؤثر ميزانية الرموز على دقة النتائج؟
أبحاث

اكتشاف مبكر لعدم توافق استنتاجات نماذج التسلسل: كيف تؤثر ميزانية الرموز على دقة النتائج؟

أركايف للذكاءمنذ 1 شهر
👁 1
التصحيح الآلي: SR-TTT والتحديات الميكانيكية في نماذج اللغة
أبحاث

التصحيح الآلي: SR-TTT والتحديات الميكانيكية في نماذج اللغة

أركايف للذكاءمنذ 1 شهر