تطور نماذج اللغة الكبيرة (Large Language Models) من أنظمة للإجابة على الأسئلة إلى عملاء متعددين الاستخدامات يتطلب أن تتجاوز معايير التقييم التقليدية مفهوم الدقة الثابتة إلى تقييم شامل يعكس الأداء في ظل مجموعة من الظروف المحيطة. ومع ذلك، فإن معظم المعايير الحالية مرتبطة بأنواع معينة من المهام أو بيئات التشغيل، مما يعوق قدرتها على المقارنة والتفسير والموثوقية في قرارات النشر.

هنا يأتي دور DAREBench، والذي يعني تقييم النماذج كعملاء بطريقة موثوقة ومراعية لبيئات النشر. تم تصميم هذا المعيار الجديد لالتقاط التنوع في أعباء العمل ودعم التقييم الموثوق للعملاء. يعتمد استعراض DAREBench على بيئة تنفيذ مشتركة تُعرف باسم OpenClaw، حيث تم تنظيم 233 مهمة مستندة إلى 22 معياراً سابقاً في مصفوفة عبء عمل تتألف من ستة أنواع بتنسيق $2 imes3$ تحددها طبيعة المدخلات والطرق التشغيلية.

قمنا بتقييم 23 نموذجاً تجارياً و12 نموذجاً مفتوح الوزن على مدار 7587 عملية نموذج-مهمة، حيث رصدنا دقة النماذج واستهلاك الرموز جنباً إلى جنب مع التكاليف المرجعية للنماذج التجارية.

تشير النتائج إلى عدم وجود نموذج واحد يسيطر على جميع مجموعات أعباء العمل، كما أن المهام النصية والمتعددة الوسائط تظهر توازنات دقة وتكلفة متميزة. كما أن النماذج المحلية المفتوحة الوزن تنافس في عدة مجموعات، ولكنها لا تزال تتأخر مقارنة بالنماذج التجارية الرائدة بشكل عام.

توصيات الدراسة تشير إلى أن عملية نشر العملاء واختيار النماذج ينبغي أن تأخذ في الاعتبار ملفات تعريف أعباء العمل، أوضاع النشر، وتوازنات الدقة والتكلفة بدلاً من الاعتماد على تسجيل إجمالي مفرد.

هذا التقدم في تقييم نماذج الذكاء الاصطناعي يفتح آفاق جديدة لفهم مدى فعالية هذه التقنيات في العمل الحقيقي، ويضع الأساس لاختيار أكثر ذكاء في المستقبل.