في عالم الأمن السيبراني، يعد تقييم المخاطر أداة حيوية لفهم التهديدات التي قد تواجه تطبيقات الذكاء الاصطناعي. قامت دراسة حديثة بإجراء تحليل متانة بيانات الحوادث في قائمة OWASP العشر الأوائل لتطبيقات نماذج اللغات الضخمة (Large Language Models) لعام 2026. تعتبر قائمة OWASP أداة شهيرة يثق بها محترفو الأمن لقياس المخاطر والأولويات.

تستند الدراسة إلى نتائج فريق من خبراء الأمان، وقد طُرحت سؤالاً محورياً: هل تتطابق تقييمات الخبراء مع سجل الحوادث الفعلي؟ لتحقيق ذلك، تم تجميع قاعدة بيانات ضخمة تحتوي على 7,714 حادثة تتعلق بالأمن و6,639 حادثة تم تصنيفها وفقًا لفئات محددة. تهدف هذه الدراسة إلى دمج تصنيفات الخبراء مع البيانات الفعلية، باستخدام نموذج قياس دقة بايزي لتحسين النتائج.

استنادًا إلى الدراسة، فإن الترتيب القائم على الحوادث يدمج بين تصنيفات الخبراء والبيانات بنسبة ثابتة تبلغ 0.75 لصالح تصويت الخبراء و0.25 لصالح البيانات. ومع ذلك، أظهرت النتائج أن الاتفاق بين الترتيبين ضعيف، حيث بلغ معامل كوهين حوالي 0.20. لكن تظل تقييمات الخبراء ذات موثوقية ملحوظة.

علاوة على ذلك، خضع التحليل لبطولة مسبقة التسجيل تضم أربع تصنيفات متقدمة، لم يحقق أي منها درجة تفوق دقة الأرضية بحساب تتوازن بمعدل 0.863. تستمر الدراسة لتأكيد ترتيب الأرضية مقابل الأسهم المحتفظ بها.

تعتبر هذه الدراسة استكشافية من قبل أعضاء مجموعة عمل، وليست الإصدار الرسمي لـ OWASP، ولا تلغي القائمة الرسمية أو العملية المتبعة.