تُعتبر نماذج اللغات الضخمة (Large Language Models) من أبرز الابتكارات في مجال الذكاء الاصطناعي، حيث تُظهر قدرة متزايدة على معالجة الأسئلة المعقدة المتعلقة بمجموعات الوثائق الخاصة بالشركات. ومع ذلك، فإن تقييم هذه الأنظمة يمثل تحديًا كبيرًا؛ إذ لا ترغب الشركات في مشاركة اتصالاتها الداخلية، بينما تفتقر البيئات الاصطناعية إلى التعقيد.

لتجاوز هذه العقبات، تم تقديم معيار CorporateBench (CB)، وهو معيار مُعتمد من البشر لتقييم استفسارات الشركات عبر مجموعة متنوعة من المهام. يمتاز هذا المعيار بحجمه الذي يقترب من الظروف التي تواجهها نماذج الذكاء الاصطناعي في شبكات الاتصالات المؤسسية، مع وجود بيانات تقييم تتجاوز 230,000 وثيقة.

يقوم CorporateBench بتقييم نماذج الذكاء الاصطناعي عبر بُعدين رئيسيين: استخراج المعلومات واستعلامات قواعد المعرفة، من خلال أربعة شركات تم توليدها بشكل اصطناعي تتراوح أحجامها من 12 إلى 10,000 موظف. كل مجموعة بيانات مأخوذة من قاعدة معرفة تتطور زمنياً، مما يضمن اتساق المنطق عبر الوثائق حتى في وجود مئات الآلاف منها.

عند إجراء تقييم لخمس نماذج لغات ضخمة باستخدام CB، تُظهر النتائج أداءً متدهورًا مع زيادة حجم المدخلات، مما يكشف عن تحديات واقعية يواجهها المطورون. يُعد CorporateBench أداة قيمة لمطوري نماذج الذكاء الاصطناعي، حيث يوفر مقياسًا دقيقًا لتقييم التفكير في سياق الاتصالات المؤسسية، ويمثل خطوة هامة في تطوير معايير مقاييس الذكاء الاصطناعي.