في الآونة الأخيرة، لفتت النماذج مفتوحة الوزن (Open Weight Models) الأنظار بالتقدم الذي حققته في المنافسات، إذ تمكنت المختبرات الصينية من المنافسة مع النماذج الاحترافية على العديد من المقاييس. ولكن هل ستستطيع هذه النماذج إثبات جدواها في المهام المالية الحقيقية؟

تحديث معيار "Financial Touchstone" الجديد يبرز ذلك، حيث يتضمن الآن 2,967 ثلاثية من الأسئلة وسياقات الإجابات المستندة إلى 495 تقريرًا سنويًا دوليًا. من خلال هذه المراجعة، قمنا بتطبيق مجموعة جديدة من النماذج، مع زيادة التغطية من أحد عشر إلى عشرين نموذجًا عبر عشرة مزودين، بما في ذلك النماذج مفتوحة الوزن مثل GLM 4.7 وGLM 5 وKimi K2.6 وDeepSeek V3.2، بالإضافة إلى نموذج Alibaba الرئيسي Qwen3-Max.

وبالنظر إلى دقة النماذج، حصل نموذج Claude Opus 4.6 من شركة Anthropic على أعلى دقة تصل إلى 88.4%، بينما يحتفظ نموذج Gemini 2.5 Pro من جوجل بأقل معدل للهذيان (0.08%). والمثير للاهتمام، أن النموذج Kimi K2.6 مفتوح الوزن احتل المركز الثالث في دقة الإجابات، في حين جاءت النماذج GLM 5 وMistral 3 في المركزين الرابع والخامس على التوالي، مما يتحدى الفكرة السائدة القائلة بأن النماذج الخاصة أو الأوزان الاحترافية ضرورية لفهم النصوص المالية بشكل قوي.

ومع ذلك، لا تزال استرجاع المعلومات (Information Retrieval) تمثل العقبة الرئيسية، حيث تمثل 48.9% من جميع الفشل في المعايير. ومن الجدير بالذكر أيضاً أننا وثقنا اكتشافًا جديدًا، وهو أن مرشحات المحتوى الجيوسياسي في النماذج الصينية ترفض بعض الأسئلة المالية المشروعة (0.08% من المحاولات)، وأحيانًا دون أسباب واضحة، وتعتمد سلوك الرفض هذا على وسيلة الوصول بقدر ما تعتمد على النموذج نفسه.

البيانات الكاملة وإطار التقييم متاحة للجمهور، مما يتيح للجميع التفاعل والاستفادة من هذه المراجع الحيوية.