في ظل التطورات الأخيرة في نماذج اللغات الضخمة (Large Language Models)، شهدنا تسارعًا كبيرًا في تنفيذ الأنظمة الذكية (Agentic Systems) في عمليات المالية. ومع اتساع نطاق استخدام هذه الأنظمة، برزت الحاجة إلى معايير دقيقة تقيس أدائها في السياق المالي الحقيقي.

المعيار الجديد المعروف باسم FORCE-Bench يأتي كخطوة متقدمة لتحقيق هذا الهدف. يُعرف هذا المعيار بأنه يتضمن 251 استفسارًا تم تعيينها من قبل خبراء، وهو مصمم لتقييم ردود الأنظمة الذكية وفقًا لإطار عمل مُعتمد يرتكز على احتياجات القطاع المالي.

يهدف FORCE-Bench إلى قياس الأنظمة الذكية عبر ثمانية أبعاد تشمل: الدقة (Accuracy)، الاقتباسات (Citations)، الوضوح (Clarity)، العمق (Depth)، الاتصال بالمعلومات (Groundedness)، الحداثة (Recency)، الملاءمة (Relevance)، والبنية (Structure). ويقوم المعيار بتقييم الأنظمة الذكية عبر ثلاثة أنواع من المهام: بحث التزامات المالية (Financial Obligation Researchبحث الأداء الكياني المالي (Financial Entity Performance Research) وتوليد ملخصات الأعمال (Business Brief Generation).

لضمان دقة النتائج، يتم تقييم الأنظمة الذكية المخصصة، بالإضافة إلى الأنظمة العامة، تحت ظروف انتشار شائعة وقيود زمنية. أظهرت النتائج أن الأنظمة العامة لم تكن دائمًا قادرة على تلبية متطلبات الجودة في المجال المالي، في حين أثبتت وكالة المالية المصممة خصيصًا لـ Microsoft 365 Copilot موثوقيتها عبر الأبعاد المختلفة.

كما تم إصدار قاعدة بيانات المعايير والأدوات والرموز التحليلية كمصدر مفتوح، مما يسهل التقييم المتكرر والتكيف مع بيئات المالية الأخرى. يعد هذا الإعلان بمثابة نقطة انطلاق جديدة لزيادة كفاءة الأنظمة الذكية في هذا المجال الهام.