في عالم باتت فيه البرامج النصية الخبيثة (malware) أحد أبرز أساليب الهجوم، يُظهر معيار SCRIPTIOC-BENCH الذي تم إطلاقه حديثًا أهمية كبيرة في تعزيز أمن المعلومات. تتضمن هذه البرامج العديد من مؤشرات التهديد (Indicators of Compromise - IOCs) التي يمكن أن توفر معلومات قيمة حول الهجمات المحتملة.

ومع ذلك، فإن استخراج هذه المؤشرات بشكل ثابت يمثل تحديًا كبيرًا، حيث تتوزع القيم ذات الصلة أو تتحول في داخل الشيفرة. على الرغم من أن نماذج اللغة الضخمة (Large Language Models - LLMs) قد أثبتت فعالية في تحليل الأمان، إلا أن قدرتها على استرجاع المؤشرات من الشفرات الضارة لم تُستكشف بشكل كافٍ حتى الآن.

في هذا الإطار، يقدّم الباحثون SCRIPTIOC-BENCH، وهو معيار يهدف إلى قياس القدرة على استخراج مؤشرات التهديد من برامج نصية خبيثة في العالم الحقيقي. يتضمن هذا المعيار 634 عينة من البرمجيات الضارة المكتوبة بجافا سكريبت (JavaScript)، وباور شيل (PowerShell)، وVBScript، تغطي أربعة أنواع من مؤشرات التهديد (الروابط، النطاقات، عناوين IP، وأدوات نظام الملفات).

بفضل هذا المعيار، يمكن تقييم مجموعة واسعة من نماذج اللغة الضخمة المملوكة والمفتوحة المصدر. ورغم التقدم الملحوظ، فإن استرجاع المؤشرات دون تنفيذ رموز الشفرة لا يزال يمثل تحديًا، حيث أن النموذج الأقوى يحقق معدل F1 يصل فقط إلى 65.4.

لتوصيف كيفية حدوث الفشل في استرجاع المعلومات، قدم الفريق تصنيفًا للنتائج السلبية، واستخدمه لمقارنة ملفات الأخطاء للنماذج التي تم تقييمها. كما قاموا بدراسة تحسينين على نموذج مفتوح المصدر صغير، وهما أدوات السلسلة الحتمية (deterministic string utilities) والتكيف الخاص بالمهام، حيث تبين أن كلاهما يحقق مكاسب في دقة الاسترجاع ويدفع الأخطاء نحو عدم تطابق متعلق بالعينة.

تُعتبر هذه التطورات خطوة قوية نحو التحسين المستمر في مجال الأمن السيبراني، وقد تلهم الباحثين والمطوّرين لاكتشاف مزيد من الحلول الفعالة.