في عالم الذكاء الاصطناعي، تتزايد تهديدات هجمات حقن الرسائل (Prompt Injection)، ولذا كان من الضروري تطوير وسائل أفضل لتقييم كاشفات هذه الهجمات. وفي هذا السياق، تم تقديم معيار PIDS-Bench كبديل متطور لتقييم آليات الكشف.
يركز هذا المعيار الجديد على تقييم الكاشفات بناءً على عدة محاور، بما في ذلك سلوكها تجاه الإدخالات المشروعة التي تحمل هيكل هجوم حقن الرسائل، مما يساهم في فهم أفضل لتفاعلات النظام. في السابق، كانت التقييمات تقاس باستخدام متوسط F1 على بيانات الاختبار، لكن هذا بات لا يقدم رؤية كافية للتكيف مع التغيرات البيانية.
يعمل PIDS-Bench على معالجة هذا القصور عبر التحليل المتعدد المحاور؛ إذ يشتمل على مجموعة من الحالات تشمل إدخالات البيانات الأساسية، وصيغ صعبة تمزج بذكاء بين البنود الشرعية ونماذج الهجمات، بالإضافة إلى تقنيات لتشفير الهجمات.
عند تقييم سبعة كتلة من كاشفات الهجمات، أظهرت النتائج أن بقاء معيار F1 مرتفعاً يمكن أن يخفي أوجه قصور أخرى. فعلى سبيل المثال، استطاع أحد الكاشفات تحقيق F1 يعادل 0.98، لكنه لا يزال يخطئ في تصنيف ثلث مجموعة بيانات مناسبة.
تواجه الكاشفات أيضاً تحدي "الدفاع المفرط" الذي يؤثر على الأداء تحت الظروف المتغيرة. حيث يتضح أن رفع نسبة الكاذبات الإيجابية يظل مسلماً بها حتى مع تنويع مصادر البيانات.
بفضل PIDS-Bench، أصبح بإمكان الباحثين والممارسين في مجالات الأمن السيبراني فهم تأثيرات الكيانات المختلفة على آليات الكشف ومواجهة التحديات المعقدة لعالم مخاطر حقن الرسائل.
هل تواجه عوائق في كشف هجمات حقن الرسائل؟ تعرف على PIDS-Bench الجديد!
تم إطلاق PIDS-Bench كمعيار مقارن جديد لتقييم كاشفات هجمات حقن الرسائل، مركزاً على سلوك الكاشفات أمام المتغيرات. هل سيلبي هذا المعيار التحديات الحالية؟
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
