في عالم المدفوعات، تعتمد العمليات المالية بشكل كبير على الأنظمة القابلة للاعتماد، ولكن غالباً ما يتسبب عدم وضوح دور نماذج اللغات الضخمة (LLMs) في هذا المجال في إرباك العاملين في القطاع. قدم فريق من الباحثين معياراً جديداً يُدعى BENCHCOMPASS، الذي يعد خطوة مهمة لتجاوز الفجوات الحالية في معالجة قاعدة بيانات المدفوعات.
تعتبر العمليات المالية ركناً أساسياً من البنية التحتية الاقتصادية، ولكن التغير السريع لقواعد المدفوعات والمعلومات المبعثرة تعيق إمكانية استخدام نماذج الذكاء الاصطناعي بفعالية. تكمن قيمة BENCHCOMPASS في قدرته على توفير مجموعة من المهام القائمة على السيناريوهات المستمدة من حزم البيانات المحددة، مما يضمن تقييماً دقيقاً للأداء.
بفضل BENCHCOMPASS، تم تحليل كيف يمكن أن تفشل النماذج بسبب نقص في المعرفة المتعلقة بقواعد المدفوعات، أو استخدام غير فعال للأدلة المقدمة، أو كيفية أدائها تحت ظروف المدخلات غير المثالية.
سيوفر هذا المعيار مراجعة من الخبراء تشمل معيار Pro الخاضع للمراجعة، الذي يغطي المعرفة والمواقف السياقية والمعالجة القوية تحت الضغط. كما تم تصميم مجموعة Normal لتقييم الأمان العام والتحقق من البيانات.
تعد النتائج لكافة نماذج BENCHCOMPASS، بما في ذلك نموذج 32B، بمثابة إنذار للمعنيين في القطاع المالي حيث تبين أن السيناريوهات المختلفة تحمل أنماط فشل نوعية.
للمزيد من التفاصيل، يمكنكم زيارة الرابط للمشروع واكتشاف كيف يمكن أن يغير BENCHCOMPASS المعايير المتعارف عليها في مجال المدفوعات.
هل يمكن للذكاء الاصطناعي تغيير قواعد اللعبة؟ اكتشفوا BENCHCOMPASS في عالم المدفوعات!
تقدم BENCHCOMPASS معياراً جديداً لتقييم أداء نماذج اللغات الضخمة في مجال المدفوعات، مما يسلط الضوء على أهمية المعرفة المخصصة والسياقات المعقدة. تعرفوا على كيفية معالجة هذا المعيار للفجوات الحالية في التقنيات المالية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
