أعلنت دراسة جديدة عن تطوير معيار لتقييم موثوقية نماذج اللغات الضخمة (LLMs) في سياق التنظيمات المعتمدة على المبادئ، حيث يستبدل هذا النموذج التقليدي دعم القوانين برؤية جديدة. في الوقت الذي تتزايد فيه استخدامات هذه النماذج كبديل للحكام في القضايا القانونية، فإن فهم كيفية قياس فعاليتها أمر بالغ الأهمية.

تقدم الدراسة أداة جديدة تُعرف باسم **Principle-Bench**، تحتوي على 168 سيناريو مالي يتعلق بالترويج للأصول الرقمية، والتي تم وضعها تحت المعيارين الرئيسيين اللذين حددتهما هيئة السلوك المالي في المملكة المتحدة (FCA). يتناول المعيار تقييم دقة النموذج في أربع محاور رئيسية: الدقة، القوة في إعادة صياغة المحتوى، القدرة على مواجهة التحديات، وضبط المعايير.

علاوة على ذلك، تم تقديم تقنية **Ceca** (تقييم عينات متعددة المعايرة)، التي تُعنى بتقديم تقييمات دقيقة وقابلة للتدقيق لكل نموذج على حدة، ما يساهم في تحسين معرفة كيفية أداء النماذج في سيناريوهات متنوعة.

أظهرت نتائج التحليل أن نموذج لذي يجسد 120 مليار معلمة يُظهر أفضل أداءً مع المدخلات العادية، ولكنه يتعرض لانخفاض كبير في دقته عندما يتعامل مع إدخالات تتضمن حيلًا مثل «نمط التزييف للتوافق». يتيح هذا المعيار تقييم النماذج بشكل أدق ويساعد المؤسسة في فهم نقاط ضعفها.

بناءً على هذه النتائج، يُظهر البحث الحاجة إلى أي نموذج LLM معتمد في تنظيم المبادئ أن يشمل تقارير عن التحايل على كل مبدأ وكذلك ضبط المعايير بعد التقييم، مما يعزز الشفافية ويعزز ثقة المستخدمين. إن هذه الطفرة في تقييم نماذج الذكاء الاصطناعي قد تكون خطوة حاسمة نحو تحسين نظام القانون والامتثال بصورة عامة.