في إطار تحدي FinMMEval 2026، أطلق فريق DS@GT تقنية جديدة تُستخدم في اختبار الأسئلة المالية متعددة اللغات، تشمل الإنجليزية، الإسبانية، اليونانية، الصينية، والهندية. يُظهر هذا الابتكار قدرة ملحوظة على معالجة الأسئلة المالية المعقدة التي تتطلب فهماً عميقاً ومنهجياً، وهو ما يتجاوز ما يمكن أن تقدمه معايير معالجة اللغة الطبيعية التقليدية.

يعمل نظام DS@GT عبر بناء خط أنابيب معزز بعمليات استرجاع المعلومات، والذي يقوم بتحديد لغة الاستعلام واسترجاع عينات ذات صلة من قاعدة بيانات معرفية متعددة اللغات تحتوي على 30,209 إدخال. اعتمد النظام على استخدام تقنيات BGE-M3 لتضمين البيانات وفهرسة FAISS لتحسين دقة البحث.

تتم عملية تقييم الإجابات بأسلوب Retrieval-Augmented Direct Scoring (RADS)، حيث يتم تحليل احتمالات تسجيل العلامات على الخيارات المحتملة بدلاً من الخروج بإجابات حرة. للتعامل مع اللغات ذات الموارد المنخفضة، تم دمج فهارس استرجاع الأسئلة بحسب اللغة وعبر اللغات باستخدام تقنية Weighted Reciprocal Rank Fusion.

اختيار النموذج يتم تحسينه تبعاً للغة: حيث تم استخدام Qwen3-14B للغات العربية، الصينية، والهندية؛ وQwen2.5-14B للغة الإنجليزية؛ وLlama-3.1-8B للغة اليونانية. يظهر التحليل التجريبي استجابة غير متكافئة في الأداء اللغوي بين النماذج المختلفة.

المفاجأة الكبرى كانت عندما أظهر استخدام أساليب التحفيز لفهم سلسلة الأفكار تدهوراً كبيراً في دقة النموذج للغة اليونانية، حيث انخفضت من 90.7% إلى 20.9%. كما أن تفعيل الوضع الافتراضي لنموذج Qwen3 أدّى إلى تدهور أداء نظام RADS باللغة العربية إلى مستويات عشوائية تقريبًا.

تشير النتائج إلى أن التقييم الفعال للأسئلة المالية متعددة اللغات يتطلب استرجاعاً مدروساً للغة، وتوجيه النماذج، واختيار استراتيجيات التقييم بعناية.