توليد النصائح المالية القابلة للتطبيق من سجلات الأعمال يتطلب من النماذج أن تدمج التفكير العددي والمعرفة بقطاع معين، بالإضافة إلى اتخاذ قرارات مدروسة، مع تجنب التوصيات التي قد تضر بالأعمال. ومع ذلك، تعتبر الإشراف المباشر تحدياً، حيث لا تعكس القرارات التاريخية بالضرورة الاختيارات المثلى، كما أن الحصول على علامات عالية الجودة في التصميم الحر يعد أمراً مكلفاً.

لقد تم صياغة مسألة توليد النصائح المالية كمشكلة تعلم معزز، حيث تم تحسين نموذج لغوي مفتوح باستخدام تحسين سياسة المجموعة النسبية (Group Relative Policy Optimization - GRPO). يعتمد نموذجنا على نظام مكافآت يستند إلى تقييم جودة النصائح، مما يضمن تقييم توصيات نموذج LLM عبر أبعاد ثنائية متعددة، مع زيادة مستوى الأمان لمنع الأضرار.

عندما ثبت أن تقييم نموذج LLM وحده لا يمكنه التحقق من كون التحسينات تعكس قيمة حقيقية للأعمال بدلاً من التكيف مع الحكم، فقد أضفنا تدقيقاً مستقلاً يعتمد على معيار تأثير المعالجة المشروط المزدوج القوي (Conditional Average Treatment Effect - CATE). وقد حقق نموذج LLM المدرب لدينا نتائج تقدر بحوالي ضعف الزيادة المخطط لها مقارنةً بأقوى أساسيات نماذج الأعمال التجارية المتاحة ($0.0228$ مقابل $0.0104$)، مع أدنى معدل انحدار وأقل مخاطر سلبية من أي سياسة تم تقييمها.

تظهر نتائجنا أن GRPO مع إشارة مكافأة قائمة على المال يمكن أن تنتج توصيات أعمال أكثر إفادة بكثير من نماذج LLM التجارية. كما أن التدقيق المستقل عن الحكم يشكل تكاملاً قيماً، بدلاً من كونه تأكيداً لتقييمات LLM كحكم في معالجة اللغة الطبيعية المالية.