في عالم متسارع نحو اعتمادية الذكاء الاصطناعي، يبرز KaliBench كمعيار متقدم يهدف إلى تقييم أدوات الأمن السيبراني على منصة كالي لينوكس. حيث تلعب النماذج اللغوية الكبيرة (Large Language Models) دورًا حيويًا في تعزيز تدفقات العمل الخاصة بالأمن السيبراني من خلال ترجمة نوايا المحللين إلى أوامر قابلة للتنفيذ.
تُظهر التقييمات الحالية التي تعتمد على المعرفة أو المهام العاملة بسهولة معينة، فجوة حادة في قياس قدرة هذه النماذج على توليد أوامر قابلة للتنفيذ لأدوات الأمن السيبراني في العالم الحقيقي. هذه الفجوة تعد حرجة، فعمليات الأمن السيبراني تحتاج إلى تنفيذ دقيق للأوامر عبر واجهات الأوامر النصية (Command-Line Interfaces)، إذ يمكن أن تؤدي الأخطاء الطفيفة في الكتابة أو الربط بين القيم والأعلام إلى فشل في التنفيذ.
يوفر KaliBench مجموعة بيانات معيارية متطورة تتضمن 8,504 أزواج من الاستعلامات والأوامر، تغطي 1,642 أداة عبر 23 بُعدًا قدراتيًا وخمس مراحل أمنية. تم بناء KaliBench من خلال عملية مدعومة بالمخطوطات لضمان الدقة القابلة للتكرار في تقييم اختيار الأدوات وبناء الحجة.
لكي نحقق صحة دلالية وقابلية تنفيذ عملية، تم تطوير خط تحقق متعدد المراحل يجمع بين التحقق المدعوم بنماذج لغوية، والتنفيذ ضمن بيئة مغلقة، وتنقيح يعتمد على الإنسان. يسهم KaliBench أيضًا في تقديم مكافآت قابلة للتحقق دون الحاجة إلى وقت تشغيل، مما يحسن أداء النماذج اللغوية.
على الرغم من وجود ثلاث أوضاع تقييم و 24 تكوينًا للنماذج، لم يتجاوز أي نموذج مفتوح الوزن 42% في دقة الأوامر بالبيئة غير المقيدة. كما تُظهر النتائج أن تحسين الإشراف والتعلم المعزز مع المكافآت القابلة للتحقق من KaliBench يحسن نموذجًا مكونًا من 8 مليارات وحدة ويحقق أداءً مماثلًا لنموذج مكون من 685 مليار وحدة.
KaliBench: معيار متقدم يثري أدوات الأمن السيبراني على كالي لينوكس!
تقدم KaliBench معيارًا جديدًا يجسد الفجوة في تقييم النماذج اللغوية الكبيرة في تطبيقات الأمن السيبراني. يساهم هذا المعيار بشكل أساسي في تحسين دقة استخدام الأوامر البرمجية على واجهات الأوامر النصية.
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
