في عصر تكنولوجيا الذكاء الاصطناعي، أصبح تقييم أمان نماذج اللغة الكبيرة (LLMs) أمرًا بالغ الأهمية لضمان قدرتها على المقاومة ضد هجمات تجاوز الحماية (jailbreak attacks). وفي هذا السياق، ظهرت NeuronFuzz كإطار عمل مبتكر يغير قواعد اللعبة في هذا المجال.
تعتمد الأساليب التقليدية لاختبار الأمان عادةً على إرجاع الردود من النموذج المستهدف، مما يعني أن كل إدخال يحتاج إلى توليد رد لتقييم فعالية الهجوم. لكن NeuronFuzz تأخذ خطوة إلى الأمام من خلال الاستفادة من "الخلايا العصبية الأمانية" (safety neurons) كتعليقات مستمرة خلال عملية التقييم، مما يسهل اكتشاف الثغرات القابلة للاستغلال.
تقوم NeuronFuzz بإنشاء ما يُسمى "SafetyOracle"، والذي يحول تنشيطات الخلايا العصبية الأمانية إلى نقاط إنذار أمان مستمرة، مما يساعد على تحديد المشكلات المحتملة دون الحاجة إلى توليد ردود معقدة. وبدلاً من ذلك، يتم استخدام اختيارات مدروسة من المدخلات الضارة والخلاقة لتحديد مجموعة فعالة من الخلايا العصبية التي تتعرف على النوايا الضارة.
هذا الأسلوب غير التقليدي أظهر نتائج مذهلة، حيث حقق معدل اكتشاف هجمات تجاوز الحماية (jailbreak discovery rate) يصل إلى 100% عبر خمسة نماذج مصدرية. كما تمكنت NeuronFuzz من تحقيق متوسط معدلات استجابة قوية (ASR) تصل إلى 69.6%، مما يعكس فعالية أساليبها على مجموعة واسعة من النماذج.
باختصار، تقدم NeuronFuzz نهجًا جديدًا ونظاميًا لتعزيز أمان نماذج اللغة الكبيرة، مما يفتح آفاقًا جديدة في مجال الذكاء الاصطناعي والاستخدامات المستقبلية.
NeuronFuzz: الثورة في تقييم أمان نماذج اللغة الكبيرة بواسطة الدليل العصبي المبتكر
تقدم NeuronFuzz إطارًا ثوريًا لتقييم أمان نماذج اللغة الكبيرة (LLMs) باستخدام خلايا عصبية أمان خاصة. هذا الابتكار يحسن من فعالية الكشف عن هجمات تكسير الحماية بنسبة تصل إلى 100%!
المصدر الأصلي:أركايف للذكاء
زيارة المصدر الأصلي ←جاري تحميل التفاعلات...
