في عالم الأمان السيبراني، يعتمد الباحثون والفرق الأمنية على أدوات استخراج الرسوم البيانية المعرفية (Knowledge Graph Extraction) لتقييم المخاطر من تقارير التهديدات، مستندين بشكل رئيسي إلى الدرجات المنشورة المعتمدة على أسلوب مطابقة البيانات. ولكن ما الذي يحدث عندما نعيد تقييم هذه الأدوات؟

أظهرت دراسة جديدة نشرت في منصة arXiv أن القواعد الموضوعة لمطابقة النتائج المتوقعة مع التقديرات الذهبية لم تكن قابلة للتطبيق إلا على خمسة من أصل اثني عشر نظامًا تم فحصه. وقد تم إعادة تقييم عشر مخرجات نظام على مستندات مشتركة تحت ثمانية بروتوكولات، مما أظهر تباينات كبيرة في الدرجات - حيث تم تعديل 11 من أصل 45 ترتيبًا.

علاوة على ذلك، عند اختبار أدوات مطابقة ميكانيكية على مجموعة بيانات خارجية تتكون من 378 عنصر، لم تتفق أي من هذه الأدوات مع تقيمات متعددة المراجعين بنسبة تفوق 71%، بينما تجاوز حكم نموذج اللغة الكبير (Large Language Model) نسبة 86%.

لتمييز تأثير المكونات من مكافآت المطابقة، تم إنشاء CTIForge، وهو إطار عمل يسمح بتغيير طبقة التحقق الخاصة به، مع الحفاظ على عملية الاستخراج نفسها دون تغيير.

وفي جميع التكوينات السبعة المختبرة، أدى التحقق إلى زيادة دقة التصنيف في جميع النتائج المستضافة، بينما أسفر عن انخفاض الدقة في الأنظمة الثلاثة غير المتصلة.

إن تنوع العوامل بين النماذج والسلوك المحدد يعتبر فصلاً وصفيًا، وليس تأثير خدمة معزولًا. وترتبط النتائج أيضًا بزيادة بمقدار 2.8 مرة في الإجراءات التي تتناقض صراحةً مع نوع الكيان، مما يتماشى مع القواعد المكتوبة التي تمثل تقنيات الاستخراج.

أخيرًا، تم إصدار مسار العمل والبروتوكولات بالإضافة إلى سجلات التدقيق لكل ثلاثي، مما يمثل خطوة هامة نحو تعزيز موثوقية أدوات استخراج البيانات وتعزيز الأمان السيبراني.