🏷️ #أداة تقييم
3 مقال
أبحاث
ثورة جديدة في تصميم الدوائر: هل يمكن لنماذج اللغة الكبرى (LLMs) أن تثبت جدارتها في التعرف على قوائم SPICE؟
أركايف للذكاءمنذ 18 يوم
👁 2أبحاث
E-Bench: أداة قياسية مبتكرة لتقييم استخدام الأدوات المتعددة الخطوات في سيناريوهات العالم الحقيقي
أركايف للذكاءمنذ 1 شهر
أبحاث
تحقيق الشفافية في تقييم نماذج اللغة: تجربة مبتكرة تعزز من مصداقية النتائج!
أركايف للذكاءمنذ 1 شهر
👁 2