في عالم يتسارع فيه استخدام الذكاء الاصطناعي (AI) في اتخاذ القرارات المالية، تظهر الحاجة إلى أدوات تقييم فعالة تعكس الواقع بشكل دقيق. هنا يأتي دور DFAH-Bench، معيار جديد تم تطويره لقياس عدم الاستقرار السلوكي في قرارات الوكلاء الماليين، وهو ما يمثل خطوة مبتكرة نحو تحسين تفاصيل هذا المجال.

يتميز DFAH-Bench بتوفير آلية تقييم تقدم تقديرات غير سابقة من خلال التركيز على ثلاث قنوات رئيسية في اتخاذ القرارات: مسارات أدوات الاتصال، اتصالات الأدلة، وتركيز القرارات. ما يجعل هذا النظام فريدًا هو عدم حاجته للوصول إلى النصوص الخفية لعمليات التفكير، مما يسهل عملية الفحص والتحليل.

خلال 8,127 تجربة إعادة تشغيل تمت عبر 10 نماذج وثلاث مهام مالية، كشفت النتائج أن الاتفاق على النتائج وحده ليس مقياسًا كافيًا للاستقرار. على سبيل المثال، يمكن للنماذج المتقدمة أن تتفق على القرارات بنسبة 95%، ولكنها تتبع نفس مسار الأدوات فقط بنسبة 77%، مما يشير إلى فجوة تبلغ 18 نقطة مئوية. بينما أظهرت أكثر من 55% من مجموعات النماذج ذات الاتفاق العالية تباينًا ملحوظًا في المسارات.

عرف الباحثون ثلاثة أنماط سلوكية رئيسية: نماذج مطابقة الأنماط التي تحقق توافقًا شبه كامل من خلال الانهيار إلى مخرجات واحدة مهما كان المدخل، المنفذون المستقرون الذين يستخدمون عمليات أدوات متسقة نسبيًا، والمتباينون في المسارات الذين يصلون إلى نفس الاستنتاجات عبر مسارات وأدلة مختلفة بشكل جوهري.

تم إطلاق كود المعيار، نصوص القياس، سجلات إعادة التشغيل، بطاقة المعيار،README الخاصة بالمجموعة المنشورة، وقائمة الإصدارات في المستودع المرافق. يمثل DFAH-Bench خطوة هامة نحو فهم أفضل لكيفية عمل نماذج الذكاء الاصطناعي في اتخاذ قرارات مالية.