في عالم إدارة الاستثمارات، يتطلب الأمر أكثر من مجرد أنظمة ذكاء اصطناعي قادرة على إنتاج نصوص مقنعة. يجب أن تكون هذه الأنظمة قادرة على استرجاع بيانات دقيقة في الوقت المناسب، وتجميع المدخلات الحسابية الصحيحة، واستدعاء الأساليب المتخصصة، وإنتاج مخرجات هيكلية يمكن التدقيق فيها. لهذا السبب، تم تقديم FinSkillBench، وهو إطار تقييم مصمم خصيصًا لمقارنة قدرة وكلاء الذكاء الاصطناعي على استخدام المهارات المالية لحل مهام إدارة الاستثمار.

يغطي FinSkillBench ثلاثة مجالات رئيسية تشمل بناء المحفظة، إدارة المخاطر، والتحليل الأساسي. يتضمن إطار التقييم 12 مهمة فرعية، مع 2,603 حالة مهمة. كل حالة تقدم مدخلات في الوقت الفعلي، وحقيقة مخفية، وكاشف محدد للمهمة.

تمت مقارنة ثلاثة ظروف مختلفة: بدون مهارة، وحزم مهارات مرتبة تتكون من مستندات إجرائية ومكونات قابلة للتنفيذ، والمهارات التي يتم إنشاؤها ذاتيًا حيث يقوم الوكيل بكتابة وإعادة استخدام إجراءاته الخاصة ضمن الحالة. أظهرت نتائج تقييم تسع نماذج مختلفة في اختبار واسع النطاق أن استخدام المهارات المرتبة يحسن الأداء بشكل ملحوظ، حيث ارتفعت الدرجات المتوسطة من 0.366 إلى 0.528، مع أكبر التحسينات في مجالي بناء المحفظة وإدارة المخاطر.

على النقيض، فإن المهارات التي تم إنشاؤها ذاتيًا لم تقدم فائدة كبيرة على الرغم من تكلفتها الحاسوبية العالية. وقد أجريت تقييمات مستقلة باستخدام إطار وكيل منفصل (Hermes Agent) حيث أظهرت النتائج نمطًا متجهًا في جميع المجالات الثلاثة، مع اختلاف حجم تأثيرات المهارات حسب المهمة والأداة المستخدمة.

تظهر هذه النتائج أن الوصول إلى مهارات إجرائية موثوقة يمكن أن يكون بنفس أهمية اختيار النموذج، بينما غالبًا ما تكون الطرق الساذجة لإنشاء المهارات غير فعالة. مع إصدار الحزمة المرجعية وأدوات التقييم وحزم المهارات المرتبة، ستكون الأبواب مفتوحة أمام مزيد من الأبحاث العميقة في هذا المجال.